{"as_of":"2026-08-17T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de23ce27370cf0ee66345083e27b201376d52e0c6afe8da17a358839a736b2f3","coverage":[{"denominator":228,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:36:55.691493Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03883/citation-record","integrity":"/paper/2509.03883/integrity","json":"/paper/2509.03883/citation-record.json","paper":"/paper/2509.03883"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:48.887967Z","title":"Deep video portraits,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:48.887967Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:800a24522dc8dfd7839ade69b366c40cce39e02ae5e51de393e9ad824ba4cace","observation_id":"f95da5f0-5166-4cbc-91b5-4003ab12495c","resolution":{"observed_at":"2026-08-05T10:36:48.887967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:48.970520Z","title":"Faceformer:Speech- driven 3d facial animation with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:48.970520Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:f6489acada3c1a53b15b94403881ad20bdd5654650da5f525fd1616d7f0c3c34","observation_id":"a24baf39-178c-4360-adda-a78ea16f0c88","resolution":{"observed_at":"2026-08-05T10:36:48.970520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T10:36:49.092801Z","title":"Make-a-video: Text-to-video generation without text-video data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.092801Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e6e0a80f649085535a0f8712cb4718b35152289c0aa9b6875754621d24a678de","observation_id":"cd7f49ad-3ec6-4700-bd27-747d8cefa3a8","resolution":{"observed_at":"2026-08-05T10:36:49.092801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.159879Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.159879Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d09c621b372ce4c2ed71aef07be38d0301376dc6a6998088320a5dac3623dec5","observation_id":"26813512-657e-4181-b184-6d7aa6204fa2","resolution":{"observed_at":"2026-08-05T10:36:49.159879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-16T12:52:49.101262Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T10:36:49.239210Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.239210Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c510dd7e3698e2d56c3c4ce94f27217d94c1f7cb4059e948b850c346a5e15b08","observation_id":"94db31dc-7003-4a00-8710-6af5c5cab0aa","resolution":{"observed_at":"2026-08-05T10:36:49.239210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.318463Z","title":"Faces that speak: Jointly synthesising talking face and speech from text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.318463Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:538f123c27e93f80e4dee5fd91d2ad6df6a788b78017e1487d6d0e1bea838be3","observation_id":"7b169ad2-017c-4d24-8270-8e3568cb2bfa","resolution":{"observed_at":"2026-08-05T10:36:49.318463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-16T14:42:12.868645Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-05T10:36:49.374447Z","title":"Magicdance: Realistic human dance video gen- eration with motions & facial expressions transfer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.374447Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:6237255a51b8f1329e9671093a37f7e0fe13e757afd6af3a9bd89746571a1f2a","observation_id":"1cef78bd-e8c1-4cf2-9800-3447126b7a23","resolution":{"observed_at":"2026-08-05T10:36:49.374447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.451505Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.451505Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:9bcf52cddd05db97633920967d5aa6478ff68d826718a8ab23192d8052ed17b2","observation_id":"d40138a0-a809-478d-b4d4-c46d4ed8ac14","resolution":{"observed_at":"2026-08-05T10:36:49.451505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.513818Z","title":"3d gaussian splatting for real-time radiance field rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.513818Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:dcf38f921db8075a3619f4037b772ea00e0e3e137523b332106bc606fc3a1f5e","observation_id":"7b7fd77b-ed8b-4cef-9f87-1a6789fa5f00","resolution":{"observed_at":"2026-08-05T10:36:49.513818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.591482Z","title":"Deep person generation: A survey from the perspective of face, pose, and cloth synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.591482Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:9d14747ed05196136a324f0168684063865487be49d8b767bf990b23219d1bf1","observation_id":"7eeb9952-bb2b-4d3b-b5c7-7f1c41679862","resolution":{"observed_at":"2026-08-05T10:36:49.591482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08428","last_updated":"2024-07-11T12:09:05Z","snapshot_observed_at":"2026-08-16T13:35:06.713015Z","submitted_at":"2024-07-11T12:09:05Z","title":"A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08428","snapshot_observed_at":"2026-08-05T10:36:49.645540Z","title":"A comprehensive survey on human video generation: Challenges, methods, and insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.645540Z"},"links":{"cited_paper":"/paper/2407.08428","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e5aae3037a69c8982634f72e86018f1678ae1d28c25ace47485c59cb2166a2d4","observation_id":"294a4644-7e29-4b56-846e-aeb8949c0813","resolution":{"observed_at":"2026-08-05T10:36:49.645540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.742383Z","title":"Image-based virtual try-on: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.742383Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ccc504e400fadf651a11481f811e9bc4a7654d28a48963795e3f830a8906a43e","observation_id":"b01d6abe-af0b-4308-b541-213e8c2377e1","resolution":{"observed_at":"2026-08-05T10:36:49.742383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10553","last_updated":"2024-06-18T07:39:51Z","snapshot_observed_at":"2026-08-16T13:42:44.763973Z","submitted_at":"2024-06-15T08:14:59Z","title":"A Comprehensive Taxonomy and Analysis of Talking Head Synthesis: Techniques for Portrait Generation, Driving Mechanisms, and Editing","version":2},"cited_work":{"arxiv_id":"2406.10553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10553","snapshot_observed_at":"2026-08-05T10:36:58.948911Z","title":"A Comprehensive Taxonomy and Analysis of Talking Head Synthesis: Techniques for Portrait Generation, Driving Mechanisms, and Editing","venue":"cs.CV","work_id":"db62db0b-665e-4c17-892f-b96f5cad664e","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.794534Z"},"links":{"cited_paper":"/paper/2406.10553","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:572b1fbe403f91e563bd862b5f2ce0eec9a5de75e40face55cb42381e199e09e","observation_id":"52958468-5877-4275-ae6e-7b9dcd5dec0d","resolution":{"observed_at":"2026-08-05T10:36:58.954166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.872986Z","title":"Multilingual video dubbing—a technology review and current challenges,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.872986Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:04e36dd40cb77f992cedf1284c92760f5042742a284bca521414512cb8a8dddd","observation_id":"f829e0b9-2e0e-4499-bada-7ba5bb7aadbc","resolution":{"observed_at":"2026-08-05T10:36:49.872986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.948773Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits anima- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.948773Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:7f01a1ce19457ea5685e050a32c31493e47f2119edaf8fe78bd217d1e2c84edd","observation_id":"b3705933-00bd-4c0b-8dea-af99e0cac63f","resolution":{"observed_at":"2026-08-05T10:36:49.948773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.025023Z","title":"Identity-preserving talking face generation with landmark and appear- ance priors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.025023Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2bd8a43b9f5e4afd9329b7961670b8b671034b6ef0f9b9a3baeddcae4a5efc01","observation_id":"20c57b9c-547e-4543-ab8f-cb9dbbbb4769","resolution":{"observed_at":"2026-08-05T10:36:50.025023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10939","last_updated":"2023-01-26T05:00:09Z","snapshot_observed_at":"2026-08-16T16:00:04.764118Z","submitted_at":"2023-01-26T05:00:09Z","title":"Affective Faces for Goal-Driven Dyadic Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10939","snapshot_observed_at":"2026-08-05T10:36:50.075167Z","title":"Af- fective faces for goal-driven dyadic communication,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.075167Z"},"links":{"cited_paper":"/paper/2301.10939","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:9329f0689b8d75d1eae981d2ac6917df8bc1db5176053e9f213e9f2d5a3411d2","observation_id":"1b2b5664-056c-4e89-9ed6-3158cdefa1af","resolution":{"observed_at":"2026-08-05T10:36:50.075167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17465","last_updated":"2023-12-04T16:49:18Z","snapshot_observed_at":"2026-08-16T14:39:21.127785Z","submitted_at":"2023-11-29T09:13:00Z","title":"AgentAvatar: Disentangling Planning, Driving and Rendering for Photorealistic Avatar Agents","version":3},"cited_work":{"arxiv_id":"2311.17465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17465","snapshot_observed_at":"2026-08-05T10:36:58.908484Z","title":"AgentAvatar: Disentangling Planning, Driving and Rendering for Photorealistic Avatar Agents","venue":"cs.CV","work_id":"de5dd4b0-a6cb-42cd-8ff2-238d72b6440f","year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.144987Z"},"links":{"cited_paper":"/paper/2311.17465","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:28ba4f0f2e7d89bbd1018fda6c2ac6f24df5804cf1cb04d3b80fe03d3de3c525","observation_id":"772294c5-ddd2-4528-8f9f-a8cd4e122bd3","resolution":{"observed_at":"2026-08-05T10:36:58.913967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.226236Z","title":"Instructavatar: Text-guided emotion and motion control for avatar generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.226236Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:24fb70d7609599af93f91773112e4d993c3cecb72753204984859789d3359a4d","observation_id":"9a49104e-7b28-46f4-b392-fc81ff03714d","resolution":{"observed_at":"2026-08-05T10:36:50.226236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.287757Z","title":"Human motion generation: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.287757Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1879c8fe8f7c7b600f859d31a72f2573362e71b35e18b425d4d9afc53a9c93d9","observation_id":"8b556212-d124-413a-80fe-02527b13bd9c","resolution":{"observed_at":"2026-08-05T10:36:50.287757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.350825Z","title":"A survey of talking-head generation technology and its applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.350825Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a1affb9871462981192276bef604a6e6bc748ad069fbb9fc7986af79a318e39b","observation_id":"4f36bf34-f59a-48cb-9bbc-a03cf0aceac9","resolution":{"observed_at":"2026-08-05T10:36:50.350825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.427366Z","title":"Unsupervised high-resolution portrait gaze correction and animation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.427366Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ad00f96bae7a612b0d9e060b67764798e93511197a6965c4ffdd41f43221c48c","observation_id":"fe0bf50d-710e-4c45-bd0a-8ecb171f4c50","resolution":{"observed_at":"2026-08-05T10:36:50.427366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.506521Z","title":"Expression domain translation network for cross-domain head reenactment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.506521Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b88c78aa10585ca4f7d9ac0c7872d88dedca883c18d6ada398d6941d0a67a863","observation_id":"96978db2-617b-45c6-a88c-2b9dcd7adace","resolution":{"observed_at":"2026-08-05T10:36:50.506521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.593467Z","title":"Otavatar: One-shot talking face avatar with controllable tri-plane rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.593467Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:5a11e2265f8c6c104eb59b56968bce7a39b0d7045793d4e644a0d5575bf5eab9","observation_id":"15cb19b0-2feb-468d-917d-09e9e1f2921c","resolution":{"observed_at":"2026-08-05T10:36:50.593467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.663654Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.663654Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1061adbdea3070768f5218d785abafd80fa6639d874190616bb04e5508aff328","observation_id":"61e15e95-e4b3-4a44-9078-783033ffbf80","resolution":{"observed_at":"2026-08-05T10:36:50.663654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-16T13:37:21.852780Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-05T10:36:50.724953Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.724953Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ba2d8a7961e3125a3749b9f830d1f5c077957637c06b9ebe1b129fcd0f0a67b9","observation_id":"32360012-a949-4738-80f6-3f8eadb82ceb","resolution":{"observed_at":"2026-08-05T10:36:50.724953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.800840Z","title":"X-portrait: Expressive portrait animation with hierarchical motion attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.800840Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:af030279b99ac19b18bc361a99347a795284bb2358ba49e12a4a74641f949ae2","observation_id":"56a2bb31-334d-4406-9232-280ad738af38","resolution":{"observed_at":"2026-08-05T10:36:50.800840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05712","last_updated":"2025-04-08T08:10:07Z","snapshot_observed_at":"2026-08-16T13:36:16.615719Z","submitted_at":"2024-07-08T08:12:57Z","title":"MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile Devices","version":3},"cited_work":{"arxiv_id":"2407.05712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05712","snapshot_observed_at":"2026-08-05T10:36:58.866954Z","title":"MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile Devices","venue":"cs.CV","work_id":"c4ac95ba-382b-4e83-8ea6-2d8b74e8a415","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.885066Z"},"links":{"cited_paper":"/paper/2407.05712","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:aa6589833a28063e3a30823b0eea01499ce06955a9fed000c5255a5c8962aaf7","observation_id":"83530f0c-6aad-4473-b9ad-45305848293f","resolution":{"observed_at":"2026-08-05T10:36:58.872770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.958740Z","title":"Everybody dance now,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.958740Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:7ec6fe36b072e7ce701b42023a71ded730e4fa963b2b941f6efe699f9da37d43","observation_id":"c0ff62f4-6f49-463f-8945-49c096b8a056","resolution":{"observed_at":"2026-08-05T10:36:50.958740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.046502Z","title":"Human motionformer: Transferring human motions with vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.046502Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d6d51539289b2e29c39634a5be1b302714c1ee0c66aacde728be5c666d239bb3","observation_id":"c22c8b7c-2ad8-42fb-9342-4e3d98fb9a9c","resolution":{"observed_at":"2026-08-05T10:36:51.046502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.122153Z","title":"Bidirectional temporal diffusion model for temporally consistent human animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.122153Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:eb6a8736e054d67334bf787b2504558fa7718ee00f41a0a83e92123c79e65122","observation_id":"36ec9f0e-890f-45dd-9bf3-6d155fb9f32c","resolution":{"observed_at":"2026-08-05T10:36:51.122153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.184832Z","title":"Disco: Disentangled control for realistic human dance generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.184832Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8371d5e623a1675b62747363313d926bccb6fdabda3d6f1cedb37058041546f2","observation_id":"376dcc8e-92eb-48a6-8726-8ea2a0052aa4","resolution":{"observed_at":"2026-08-05T10:36:51.184832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.227878Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.227878Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2e56203e87639aa159a37826d6a6814d224583b563fe2d13946fe9ee87357e4e","observation_id":"0e943829-ccb7-47e3-93fa-a4f5586821f7","resolution":{"observed_at":"2026-08-05T10:36:51.227878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03035","last_updated":"2025-03-01T09:24:04Z","snapshot_observed_at":"2026-08-16T13:45:59.839510Z","submitted_at":"2024-06-05T08:03:18Z","title":"Towards Multiple Character Image Animation Through Enhancing Implicit Decoupling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03035","snapshot_observed_at":"2026-08-05T10:36:51.276195Z","title":"Follow-your-pose v2: Multiple- condition guided character image animation for stable pose control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.276195Z"},"links":{"cited_paper":"/paper/2406.03035","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:fcf7013501be5ed82767aeca6912ab55a5fcba436c9e824ae78cc8446318964d","observation_id":"3362df08-e56c-40f9-82cb-c6b2badd3684","resolution":{"observed_at":"2026-08-05T10:36:51.276195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17405","last_updated":"2024-09-23T20:52:01Z","snapshot_observed_at":"2026-08-16T13:48:56.392885Z","submitted_at":"2024-05-27T17:53:29Z","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17405","snapshot_observed_at":"2026-08-05T10:36:51.336374Z","title":"Human4dit: Free-view human video generation with 4d diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.336374Z"},"links":{"cited_paper":"/paper/2405.17405","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:eaf3c138fd6b3128f1559f1515d41105b28d066fe48ebe31de568f17d7b3753b","observation_id":"fd85064b-470f-4b74-a4e5-6886a46b3cf6","resolution":{"observed_at":"2026-08-05T10:36:51.336374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-05T10:36:51.408510Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.408510Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1649e81e92f413961b512fac057c66be4b795c4feb71f04fc530aae1ffc33674","observation_id":"2b9aff82-d393-46fd-87cf-80804041afcd","resolution":{"observed_at":"2026-08-05T10:36:51.408510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.491529Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.491529Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:54d14bd552d7d0c9ab75c4d2ebb71b15597ff79bb1cceffbc681afbcc38baaa8","observation_id":"c63e07aa-2336-4688-a64f-0b50089fa4a4","resolution":{"observed_at":"2026-08-05T10:36:51.491529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11794","last_updated":"2024-05-28T04:08:09Z","snapshot_observed_at":"2026-08-16T13:51:25.943279Z","submitted_at":"2024-05-20T05:28:22Z","title":"ViViD: Video Virtual Try-on using Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11794","snapshot_observed_at":"2026-08-05T10:36:51.546340Z","title":"Vivid: Video virtual try-on using diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.546340Z"},"links":{"cited_paper":"/paper/2405.11794","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4ced80bb5d083b72b87266d2231e4ccb05b6fe65114e1ddc061ebda64729aa9c","observation_id":"fa9be2f3-e5e9-410a-b530-6a312ebe37a2","resolution":{"observed_at":"2026-08-05T10:36:51.546340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.631647Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.631647Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4f07b0c10c560c6d5722de5e186eb57f8d886d09f42715562480c541bc1e72a3","observation_id":"d2cc0be8-39bb-45d9-9c37-b4ecd5fd78aa","resolution":{"observed_at":"2026-08-05T10:36:51.631647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.697233Z","title":"Make-your-anchor: A diffusion-based 2d avatar generation frame- work,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.697233Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2848916e7314adcfee9d0201a9dd70671be8f7374cda125d4202d02316dc7756","observation_id":"9d8ee456-6b82-45e0-ad5d-8ea8e26f1ef1","resolution":{"observed_at":"2026-08-05T10:36:51.697233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.768275Z","title":"Write-a-speaker: Text-based emotional and rhythmic talking-head gen- eration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.768275Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d306675cad8371243b593e7230994cc7d352af585be273758fb8a32a43484176","observation_id":"427b93f9-4609-4dbb-9155-50f757a47e9d","resolution":{"observed_at":"2026-08-05T10:36:51.768275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-16T13:58:25.984156Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-05T10:36:51.833596Z","title":"Id-animator: Zero-shot identity-preserving human video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.833596Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8781779b6c059c42f23700619da607a25eef5d00fa09e498d59e10e8e46f6d7c","observation_id":"5039d190-f301-4c72-9d74-ef59776b9279","resolution":{"observed_at":"2026-08-05T10:36:51.833596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04496","last_updated":"2024-10-15T03:43:36Z","snapshot_observed_at":"2026-08-17T03:10:11.420127Z","submitted_at":"2024-05-07T17:06:59Z","title":"Edit-Your-Motion: Space-Time Diffusion Decoupling Learning for Video Motion Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04496","snapshot_observed_at":"2026-08-05T10:36:51.888269Z","title":"Edit-your-motion: Space-time diffusion decoupling learning for video motion editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.888269Z"},"links":{"cited_paper":"/paper/2405.04496","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d00b135f32cf795d419a87905a23bb01e22c6fb70bd4b309a29dd98c4c4d748d","observation_id":"26db761e-aec1-4493-a7a7-cda9aa260e5c","resolution":{"observed_at":"2026-08-05T10:36:51.888269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.996370Z","title":"Follow your pose: Pose-guided text-to-video generation using pose- free videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.996370Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:cf3badd6adc7e7c2848d6b55d78319d30a932dfe72b2969fc80347e1b7644286","observation_id":"d555322f-e779-41da-9a18-576579a9c741","resolution":{"observed_at":"2026-08-05T10:36:51.996370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.049764Z","title":"Text2performer: Text-driven human video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.049764Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:87faaae63489a6a150a5ac4112a6e3f6b85205aa83a383a095e1aef5869356b2","observation_id":"9cc1b22d-2e2c-43b6-b574-ba33f0834aa2","resolution":{"observed_at":"2026-08-05T10:36:52.049764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.111709Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.111709Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e2302e911cba3a66260e92ab3bdda10950f15f6dba77fe095c01cbd5ad2de9ec","observation_id":"bbe3cd7c-9b7f-48d4-8566-34a95489be60","resolution":{"observed_at":"2026-08-05T10:36:52.111709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.290746Z","title":"Pose- controllable talking face generation by implicitly modularized audio- visual representation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.290746Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:f8433ebf7004b6a02a5a320daa495d3e5180a9e5ffe14dae5e548a724f52f2f6","observation_id":"6993dca4-834c-4cac-bfaf-32c063d5f9b6","resolution":{"observed_at":"2026-08-05T10:36:52.290746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.375519Z","title":"Edtalk: Efficient disentanglement for emotional talking head synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.375519Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b94b986ec9c1482e247374d30efd2f708539d963933ed2931fe28be889401745","observation_id":"09be9cb8-1621-43ec-9083-065b215e6636","resolution":{"observed_at":"2026-08-05T10:36:52.375519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-16T13:35:14.800191Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-05T10:36:52.470098Z","title":"Echomimic: Lifelike audio-drivenportraitanimationsthrougheditablelandmarkconditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.470098Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a005daf94ba5a7ba7165b1fffde945447fff6b88eaf25b77e0cb532b3b44a819","observation_id":"e47c006d-73d1-47e7-8e90-e6c2ecf9bc31","resolution":{"observed_at":"2026-08-05T10:36:52.470098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.561850Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.561850Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:63899d76a14202b23b326d6c8bfb04fffac6a0538ae9b334e3b98a46c63f2dc9","observation_id":"908e1770-efa3-4e48-8a70-5ecf9d94803f","resolution":{"observed_at":"2026-08-05T10:36:52.561850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-16T13:43:29.827089Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T10:36:52.656632Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.656632Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2c5abfec015c98bd5824c98ff21b291250368a35bc3cc2650bfe5d392475b220","observation_id":"e0f06b7c-dffa-4f88-a39b-534522cb11ef","resolution":{"observed_at":"2026-08-05T10:36:52.656632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07895","last_updated":"2024-06-12T06:00:00Z","snapshot_observed_at":"2026-08-16T13:43:54.409680Z","submitted_at":"2024-06-12T06:00:00Z","title":"Emotional Conversation: Empowering Talking Faces with Cohesive Expression, Gaze and Pose Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07895","snapshot_observed_at":"2026-08-05T10:36:52.721044Z","title":"Emotional conversation: Empowering talking faces with cohesive expression, gaze and pose generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.721044Z"},"links":{"cited_paper":"/paper/2406.07895","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:015eb07d7a7daa220cccc0005a406a66960faa59674486bbbcedce46518c46e8","observation_id":"1840df13-0112-470c-926c-ea26659a34e1","resolution":{"observed_at":"2026-08-05T10:36:52.721044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.772995Z","title":"Makeittalk: Speaker-aware talking-head animation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.772995Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:86fa1016b5281465f88a47b02571d9176c348f406191db6f528cc106c650282b","observation_id":"db688d56-7413-4c21-a9cb-29c65e141393","resolution":{"observed_at":"2026-08-05T10:36:52.772995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.824523Z","title":"Live speech portraits: Real-time photore- alistic talking-head animation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.824523Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4fbb0451be23efeeff57c2b9acb59828aa761087f7ad797bdb17cc0b0312f667","observation_id":"b815adc8-8abc-4055-8865-f5e35b3ae217","resolution":{"observed_at":"2026-08-05T10:36:52.824523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-08-16T14:10:04.752083Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-05T10:36:52.868747Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.868747Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ac148f9c40c2da2762b4153bd94181390f86766a764a819db07c6dc5f8e7a728","observation_id":"75aff3a9-89ae-4ee7-82fe-024be2d77f6e","resolution":{"observed_at":"2026-08-05T10:36:52.868747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09266","last_updated":"2024-11-28T10:30:14Z","snapshot_observed_at":"2026-08-16T13:52:31.498631Z","submitted_at":"2024-05-15T11:33:07Z","title":"Dance Any Beat: Blending Beats with Visuals in Dance Video Generation","version":3},"cited_work":{"arxiv_id":"2405.09266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09266","snapshot_observed_at":"2026-08-05T10:36:58.675160Z","title":"Dance Any Beat: Blending Beats with Visuals in Dance Video Generation","venue":"cs.CV","work_id":"fc7ef36e-3d46-44ac-8847-0e8df07313e8","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.930420Z"},"links":{"cited_paper":"/paper/2405.09266","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:dba2bc08ed10c31952544f629e8e64bba5477a748370d01001d40e755b22e1ce","observation_id":"e4ed9920-2db5-4442-853b-631547e6c554","resolution":{"observed_at":"2026-08-05T10:36:58.680484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T10:36:52.986651Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.986651Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:79766ab77cdf34e818be8bd5f4336141f6445a7c5fc9551a99be37b7f794b1cf","observation_id":"4dd2bf06-54a9-41ab-85b5-337b555a0042","resolution":{"observed_at":"2026-08-05T10:36:52.986651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.070888Z","title":"Geneface: Generalized and high-fidelity audio-driven 3d talking face synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.070888Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:90c81f8cf7ba08041d02e081a80dd2cae7146aba9ead7449e8d3e3e16d977944","observation_id":"3083795b-dd6a-49a6-b9bb-51d2e49b28e8","resolution":{"observed_at":"2026-08-05T10:36:53.070888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00787","last_updated":"2023-05-01T12:24:09Z","snapshot_observed_at":"2026-08-16T15:36:32.422320Z","submitted_at":"2023-05-01T12:24:09Z","title":"GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00787","snapshot_observed_at":"2026-08-05T10:36:53.123535Z","title":"Geneface++: Generalized and stable real-time audio-driven 3d talking face generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.123535Z"},"links":{"cited_paper":"/paper/2305.00787","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:bf94170ea79536d67c29052d2a01c292eddd8aa6a2c4af36db95749e36b48516","observation_id":"d79c4897-2ea4-4059-bd1f-e962667fb198","resolution":{"observed_at":"2026-08-05T10:36:53.123535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.184941Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.184941Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:604575c4b1ea2984fe829e49caf1c6313e031d6e76a8f5dc74b20f0b763ae4f5","observation_id":"cb5922ee-b2fb-48c4-8552-736c338f3a81","resolution":{"observed_at":"2026-08-05T10:36:53.184941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.226243Z","title":"Generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.226243Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:95faba48057f0bbca2c0f765b4ae160b7e5b5697082b811a583c959be721f504","observation_id":"b3d7e218-04ec-42f8-a14d-a7c24694e47b","resolution":{"observed_at":"2026-08-05T10:36:53.226243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.303004Z","title":"A style-based generator architecture for generative adversarial networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.303004Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:7898e717562d745787168aee5e15daf6d2d67248b36b41828295bd0a780c3cf3","observation_id":"8033ef9e-f150-46a2-af76-6b2d726a9db5","resolution":{"observed_at":"2026-08-05T10:36:53.303004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.394240Z","title":"Analyzing and improving the image quality of stylegan,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.394240Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:57066b29f78045b016208bb2423b4d089630250fee88a6e1e130c45078e446f0","observation_id":"c9f97cf7-0614-4fa7-989d-6b4aee2fb06d","resolution":{"observed_at":"2026-08-05T10:36:53.394240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.443233Z","title":"An identity-preserved framework for human motion transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.443233Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:158074c01cce068b97712f1a97519081407994eb395251c0364ce5b7ee17d90a","observation_id":"85c06782-9c16-45a3-a75a-1911663f5447","resolution":{"observed_at":"2026-08-05T10:36:53.443233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.506844Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.506844Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2041500bb0e7ca593cb2272c9b96372fac0e4ed65ab19fc932035fb19e4c95a3","observation_id":"39d5a18e-48cc-4112-b3e6-17f8765e922c","resolution":{"observed_at":"2026-08-05T10:36:53.506844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.572864Z","title":"Improved techniques for training score-based generative models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.572864Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:199f6f189c26c630fdb146ec03da672a3d26e48957dc425de48f4b80ec589983","observation_id":"48c3a0b4-1986-412c-bde6-5acd5cac82a3","resolution":{"observed_at":"2026-08-05T10:36:53.572864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.628440Z","title":"Improved denoising diffusion proba- bilistic models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.628440Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:696394989ee72b74a482ed3c032d71ffec705d974fba80a557f49b9309c649cf","observation_id":"e63960fd-1b14-47fe-b658-9c84020277ed","resolution":{"observed_at":"2026-08-05T10:36:53.628440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.693869Z","title":"Denoising diffusion implicit mod- els,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.693869Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:77a708b4859af042c48b0594d8da945e446a09ef89387fba9db499f7240422ef","observation_id":"41063b16-eb8b-410f-943a-b7554e3697c2","resolution":{"observed_at":"2026-08-05T10:36:53.693869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.755074Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.755074Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:0a3106a85f3635560908e3f2e300ab146b9b72399689c20a3c58049d60808f0f","observation_id":"23363c7a-46bb-418b-9d09-6ed5900097d3","resolution":{"observed_at":"2026-08-05T10:36:53.755074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.789291Z","title":"A survey on generative diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.789291Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:40bfedea08f805c8198fc777be0baf3cee49a8acba018eb4ad0aa5017f1ac50f","observation_id":"cff4e806-623b-46ca-b538-4a87f6e4e325","resolution":{"observed_at":"2026-08-05T10:36:53.789291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.822594Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.822594Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:15c922a82d74c009c45acf29bbf8b3a5ade795f78a4b090746284d99e4524fb1","observation_id":"902e7970-5ad5-45b6-ac03-5b2b8410360d","resolution":{"observed_at":"2026-08-05T10:36:53.822594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14780","last_updated":"2023-10-20T12:53:08Z","snapshot_observed_at":"2026-08-16T14:50:24.745772Z","submitted_at":"2023-10-20T12:53:08Z","title":"Dance Your Latents: Consistent Dance Generation through Spatial-temporal Subspace Attention Guided by Motion Flow","version":1},"cited_work":{"arxiv_id":"2310.14780","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14780","snapshot_observed_at":"2026-08-05T10:36:58.617590Z","title":"Dance Your Latents: Consistent Dance Generation through Spatial-temporal Subspace Attention Guided by Motion Flow","venue":"cs.CV","work_id":"0dd2366d-d12b-4e45-b170-c8781d0ac65f","year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.851100Z"},"links":{"cited_paper":"/paper/2310.14780","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:88c19e7715b20b1c333cff4dff3b2b4e5c620f660358f8e16a9b3405b7ee6527","observation_id":"722e2ae5-ab12-4b38-97fe-1aa5f7795f8d","resolution":{"observed_at":"2026-08-05T10:36:58.622748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19290","last_updated":"2024-06-27T16:04:41Z","snapshot_observed_at":"2026-08-16T13:39:01.308974Z","submitted_at":"2024-06-27T16:04:41Z","title":"Human Modelling and Pose Estimation Overview","version":1},"cited_work":{"arxiv_id":"2406.19290","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19290","snapshot_observed_at":"2026-08-05T10:36:58.591925Z","title":"Human Modelling and Pose Estimation Overview","venue":"cs.CV","work_id":"47cdf20a-79bd-41f5-a613-f5c8f8ad7f75","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.890018Z"},"links":{"cited_paper":"/paper/2406.19290","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ba4f020ada4bb11598da4308fc93f813316fc62dfc6c5b9e2c9c2015de7ec07e","observation_id":"4ee471ec-042e-4a69-8fd4-a15731b82897","resolution":{"observed_at":"2026-08-05T10:36:58.598466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.932596Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.932596Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2be24aa7afefbcb22ce43863cc41f41a9b25dd5ea637ce22e19b91a650d6f960","observation_id":"1c81d839-0969-4e81-aed5-9c32b5da1054","resolution":{"observed_at":"2026-08-05T10:36:53.932596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.005829Z","title":"Openpose: Realtime multi-person 2d pose estimation using part affinity fields,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.005829Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8ac6367df5005f87cff5448f20398cc9f212b7fd35d5d2b6a3372a0ec4ee8be6","observation_id":"3d3ca1b2-7a7e-41b2-a397-b9d0a406c75e","resolution":{"observed_at":"2026-08-05T10:36:54.005829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.073205Z","title":"Effective whole-body pose estimation with two-stages distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.073205Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b192857c8f491e62225f53083a3827df80f424c3aa19c564ce3e25747d30579d","observation_id":"00303c56-3dd2-43b6-a9c8-d02c764d3a83","resolution":{"observed_at":"2026-08-05T10:36:54.073205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18156","last_updated":"2024-05-28T13:18:32Z","snapshot_observed_at":"2026-08-16T13:48:37.733181Z","submitted_at":"2024-05-28T13:18:32Z","title":"VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18156","snapshot_observed_at":"2026-08-05T10:36:54.118365Z","title":"Vividpose: Advancing stable video diffusion for realistic human image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.118365Z"},"links":{"cited_paper":"/paper/2405.18156","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c285ef05336dc69f815fccdf5a8f0a7c9ca6addd06a329822e129600fe5904cd","observation_id":"fca9ccc0-861b-41cd-a53e-4046ced5ca35","resolution":{"observed_at":"2026-08-05T10:36:54.118365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.172725Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.172725Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d7e1b4a024f94bfd0d6b409327032d34b9dc51fd11fbf5a7177965558b8326bc","observation_id":"8cef5567-ea4f-42e2-8552-9e11eea741bb","resolution":{"observed_at":"2026-08-05T10:36:54.172725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.269247Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.269247Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b14ff2ef2a13da48fc549f930f6c60e8da94d3bd42396465e7aed7330dddfa40","observation_id":"c0371e81-1ba4-4557-89c8-b7d49adb864e","resolution":{"observed_at":"2026-08-05T10:36:54.269247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.305057Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.305057Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2f27c8c7e1660ba40f056b8fb2c99268bab1652512099fe033ec96fd72933f22","observation_id":"53c38695-d68d-4e77-95e5-73b17a9f919f","resolution":{"observed_at":"2026-08-05T10:36:54.305057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.380434Z","title":"Omniavatar: Geometry-guided controllable 3d head synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.380434Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b82d72289ea8f6e3c6b1a75b6c6d36b621ad02b880295eef92b5e4733f7c0a38","observation_id":"00de6092-d0b5-4c1e-b388-ef81c2fb428b","resolution":{"observed_at":"2026-08-05T10:36:54.380434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20851","last_updated":"2024-06-18T05:36:11Z","snapshot_observed_at":"2026-08-16T13:47:25.086807Z","submitted_at":"2024-05-31T14:33:13Z","title":"MegActor: Harness the Power of Raw Video for Vivid Portrait Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20851","snapshot_observed_at":"2026-08-05T10:36:54.430237Z","title":"Megactor: Harness the power of raw video for vivid portrait anima- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.430237Z"},"links":{"cited_paper":"/paper/2405.20851","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:fbaed0a1b4503a0d57bc47d35eca45a4aa76aec55aa00b6bb0ff5aefa9122660","observation_id":"f3e72e65-8d87-413e-a9b3-442f8a2327e3","resolution":{"observed_at":"2026-08-05T10:36:54.430237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.497161Z","title":"Faceoff: A video-to-video face swapping system,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.497161Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a5ede00c9317c47b9e87268b3ce36910b55b0fa36a4ee0274225ace5995fae4c","observation_id":"bb96ac18-cfcb-4dd1-addf-5fc27ca2a887","resolution":{"observed_at":"2026-08-05T10:36:54.497161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.633347Z","title":"Finemogen:Fine- grained spatio-temporal motion generation and editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.633347Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ac9c6e00bd2f13ded832c444bd0ba40a8dcdb8f55e6de09c278ab5868dad7f1b","observation_id":"1031deee-83e3-44be-ae43-5bebd3d0aa85","resolution":{"observed_at":"2026-08-05T10:36:54.633347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14828","last_updated":"2023-12-22T17:02:45Z","snapshot_observed_at":"2026-08-16T14:32:09.392294Z","submitted_at":"2023-12-22T17:02:45Z","title":"Plan, Posture and Go: Towards Open-World Text-to-Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14828","snapshot_observed_at":"2026-08-05T10:36:54.701074Z","title":"Plan, posture and go: Towards open-world text-to-motion generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.701074Z"},"links":{"cited_paper":"/paper/2312.14828","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b9d36f7af5ce2fa02f88d5b4828ef8460e59b129106399c4387aa0065d67b7c8","observation_id":"adf6c3d4-e998-4b9e-b1a5-84e6f8448b0f","resolution":{"observed_at":"2026-08-05T10:36:54.701074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.779686Z","title":"Avatargpt: All-in-one framework for motion understanding planning generation and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.779686Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4c1d32da5c17eafcdaacbc7e23ec76d05e3cd04b783899fb8cf04586dfe099e5","observation_id":"4d30bd36-f327-41d8-b0e1-3e1bc4a9f982","resolution":{"observed_at":"2026-08-05T10:36:54.779686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.842912Z","title":"Motiongpt:Finetunedllmsaregeneral-purpose motion generators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.842912Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:7ba8c9cdead38a0bcb8f8d92917d7deef90647905ba6756db8accd1101e7efda","observation_id":"1c3d735b-8c4f-4ff5-996e-a0d9bad80c5c","resolution":{"observed_at":"2026-08-05T10:36:54.842912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.12634","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:58.513311Z","title":"Motionscript: Natural language descriptions for expressive 3d human motions,","venue":null,"work_id":"88c2f1c0-1235-4d4d-8c30-a24a8e9ac396","year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.889171Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c22b801711428070db08e640e692b355ef72758a13e28d2ae17a07522993e773","observation_id":"1f47c7cd-23b3-45ad-89d5-e377bb05ad77","resolution":{"observed_at":"2026-08-05T10:36:58.521924Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.941478Z","title":"Can language models learn to listen?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.941478Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1776b8c9dd41a6e5216cda44160856ac9c8b6f9750d62b19441f04840098208e","observation_id":"52cd2ab0-f22e-4a3b-8213-f8f36c2ea07c","resolution":{"observed_at":"2026-08-05T10:36:54.941478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.987297Z","title":"Intercontrol: Zero-shot human interaction generation by controlling every joint,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.987297Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:46e79b372dbc0a452820b1c0140c57aa01966caedeba6718a1df6f1dfe0913a9","observation_id":"fae80bfd-7c96-4782-88fc-93930b81ffc6","resolution":{"observed_at":"2026-08-05T10:36:54.987297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.061656Z","title":"Digital life project: Autonomous 3d characters with social intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.061656Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:34ee31d1b080edcc47b50bd73306ad2c05efd41e92a2391416664448e602161c","observation_id":"ef22c8f3-2093-4d31-81c7-6e7635981c47","resolution":{"observed_at":"2026-08-05T10:36:55.061656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05412","last_updated":"2025-06-18T10:45:08Z","snapshot_observed_at":"2026-08-16T13:27:20.371596Z","submitted_at":"2024-08-10T02:46:11Z","title":"Style-Preserving Lip Sync via Audio-Aware Style Reference","version":2},"cited_work":{"arxiv_id":"2408.05412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.05412","snapshot_observed_at":"2026-08-05T10:36:58.388816Z","title":"Style-Preserving Lip Sync via Audio-Aware Style Reference","venue":"cs.CV","work_id":"4eeaf445-7f68-4d7b-ae34-80abb04cf2d2","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.147557Z"},"links":{"cited_paper":"/paper/2408.05412","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:f866b6bf255c52c51f1e35108ff2ed9d59e8292c4a501059552f85115a3e472e","observation_id":"ab34fd6c-d07c-4b82-8c22-208514e94cc1","resolution":{"observed_at":"2026-08-05T10:36:58.393948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.219526Z","title":"Dae-talker: High fidelity speech-driven talking face generation with diffusion autoencoder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.219526Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:9fab26f90d7798947d62cf4f5f3b9378a960774a544ed5c5b2ee1091c9ff9fb5","observation_id":"cef580a5-5bc0-4f25-9d36-dc9475c1b393","resolution":{"observed_at":"2026-08-05T10:36:55.219526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.341313Z","title":"High-fidelity generalized emotional talking face generation with multi-modal emotion space learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.341313Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:be98352e4ea3a8f42cfd94b0b58e3b0df4b716872a8c1946f8f6c591145035e1","observation_id":"3940f10e-57e5-4fed-9b1f-410f2e027b65","resolution":{"observed_at":"2026-08-05T10:36:55.341313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.437623Z","title":"Do as i do: Pose guided human motion copy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.437623Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c930ed72a389649d4e37a0e196f89085e1a5f38c2bd8bf0b97b86a4325322cdb","observation_id":"6f19b458-6964-4118-b3e8-de5a03a081fd","resolution":{"observed_at":"2026-08-05T10:36:55.437623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.499737Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.499737Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:3805fc2c62ee9a604393e35ae62eaa42950c1d2dbba127f65eb4a76ece1027f4","observation_id":"a0884bf4-d635-46bb-87a5-e0fe8da07a45","resolution":{"observed_at":"2026-08-05T10:36:55.499737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-08-16T14:36:30.066266Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-08-05T10:36:55.542297Z","title":"Dreamoving: A human dance video generation framework based on diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.542297Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:cc11aaa0333ce9ae02c8da593a92bdc521df3af8ad24e2d38c96262e5a19f70d","observation_id":"0aa3248d-5c1b-43a6-8876-4d88a106f95d","resolution":{"observed_at":"2026-08-05T10:36:55.542297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16393","last_updated":"2024-05-28T05:25:00Z","snapshot_observed_at":"2026-08-16T13:53:17.702283Z","submitted_at":"2024-05-26T00:53:26Z","title":"Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation","version":2},"cited_work":{"arxiv_id":"2405.16393","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16393","snapshot_observed_at":"2026-08-05T10:36:58.346870Z","title":"Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation","venue":"cs.CV","work_id":"869aa1e2-2bda-43b8-a154-fabc4a424e3f","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.595181Z"},"links":{"cited_paper":"/paper/2405.16393","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:3945747a12836d1a10b092c17d3083da1b661ad2169d55cb8a5ddd58689457e0","observation_id":"cb9c6960-cff5-4172-adef-5badaf5e1108","resolution":{"observed_at":"2026-08-05T10:36:58.352828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20325","last_updated":"2024-05-30T17:57:30Z","snapshot_observed_at":"2026-08-16T13:47:38.427202Z","submitted_at":"2024-05-30T17:57:30Z","title":"MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20325","snapshot_observed_at":"2026-08-05T10:36:55.671513Z","title":"Motionfollower: Editing video motion via lightweight score-guided diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.671513Z"},"links":{"cited_paper":"/paper/2405.20325","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ef425431efdf61460ecfc183673d7c3f23cfddc99d0995bf519f2cd923b8ab4f","observation_id":"6172c528-1170-46b3-a805-c2950208d190","resolution":{"observed_at":"2026-08-05T10:36:55.671513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-08-16T13:46:48.373648Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-05T10:36:55.691493Z","title":"Unianimate: Taming unified video diffusion models for consistent human image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.691493Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:bae500da77e00623068124d02114e783bfdf6bce65687b94f945240c8305c8d3","observation_id":"67aa83bb-1e4d-451d-8d3c-178e608f0a1e","resolution":{"observed_at":"2026-08-05T10:36:55.691493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:22:48.616400Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":228},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 228 outbound references and 0 inbound Pith citation observations for arXiv:2509.03883."}