{"as_of":"2026-08-14T13:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef4481e727814f1bc9307d67246634bd65e0acd13970c20b87d25be084962f00","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:24:08.721929Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.08891/citation-record","integrity":"/paper/2508.08891/integrity","json":"/paper/2508.08891/citation-record.json","paper":"/paper/2508.08891"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T21:24:05.359067Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.359067Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:7b64eb1527a6b22515aaa593d392bea9e792a5232054ffb6e591932dfcd5867c","observation_id":"de2bf21f-4036-459e-8002-dcefadac5b4b","resolution":{"observed_at":"2026-08-05T21:24:05.359067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:05.426808Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.426808Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:8322e7b983ca525cb90610bae3a62492d05b967c1c1a9392694ccbe1169cbef7","observation_id":"f01b6fc9-2761-4af7-8c24-c0df7620a36c","resolution":{"observed_at":"2026-08-05T21:24:05.426808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17198","last_updated":"2025-02-24T14:31:20Z","snapshot_observed_at":"2026-08-07T17:53:08.807427Z","submitted_at":"2025-02-24T14:31:20Z","title":"Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17198","snapshot_observed_at":"2026-08-05T21:24:05.525128Z","title":"Dimitra: Audio-driven dif- fusion model for expressive talking head generation.arXiv preprint arXiv:2502.17198, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.525128Z"},"links":{"cited_paper":"/paper/2502.17198","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:5aa84a38dfd1ee3203d7912ce54cbc339c9b5cd57a96d8dbe04764fee3a9e381","observation_id":"66a2cb35-9ef2-4aa1-990f-4f17cadf014f","resolution":{"observed_at":"2026-08-05T21:24:05.525128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-12T22:26:33.059926Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-05T21:24:05.595256Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.595256Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:eab866ead281f6ac02706b6e5478f49d6d675477fdc13be01748cd4405933da5","observation_id":"9d7248bf-9fae-4233-a7e6-de05a57562a0","resolution":{"observed_at":"2026-08-05T21:24:05.595256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-12T11:06:26.827328Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T21:24:05.723175Z","title":"Hallo3: Highly dynamic and realistic portrait image an- imation with diffusion transformer networks.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.723175Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:1dfb0f0a0e98167d4a7877237d360dfc3c1f73d5d51f0e2bf93e9d14ae3367f6","observation_id":"d160ab63-8d60-43af-b7dd-56f2ed06878c","resolution":{"observed_at":"2026-08-05T21:24:05.723175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:11.506465Z","title":"Gemini 2.5 pro: Our most intelligent ai model, 2025","venue":null,"work_id":"dc51e5de-bfe7-4800-88fc-b4597865ed4e","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.819589Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:6f18e8271b237710bd8de84b72c46863a5c4294aa3b5b08311d9dfa4559ddfdc","observation_id":"d42da7a8-dbf2-4411-9906-0afc46933a68","resolution":{"observed_at":"2026-08-05T21:24:11.556123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:11.340264Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor","venue":null,"work_id":"cb8dbb48-0507-4658-8d20-fa87f4a27ac8","year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.908061Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:6182ac06f0a79afe67ef2367bd45c364b13531f11b7e6036dd8661b5f7f49ba2","observation_id":"dd4d3973-3b7d-4bba-98d6-54fc4a4c9f97","resolution":{"observed_at":"2026-08-05T21:24:11.416785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T21:24:06.035484Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.035484Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a14a07f78873e4f7488428ec503e6e01251addd87a7ecc24b69c1782292b7ad4","observation_id":"02cab4ec-693a-4221-b10c-8befa4cd10b2","resolution":{"observed_at":"2026-08-05T21:24:06.035484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:06.127789Z","title":"Video dif- fusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.127789Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:0226a09cd67dec9ff285a291e7fac17fe5877ecfbf4f7f1ba2edc3dd0d70b4f0","observation_id":"34596d63-1629-49b9-8b82-950be13908ba","resolution":{"observed_at":"2026-08-05T21:24:06.127789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11251","last_updated":"2025-03-14T10:01:55Z","snapshot_observed_at":"2026-08-09T05:35:15.000362Z","submitted_at":"2025-03-14T10:01:55Z","title":"Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11251","snapshot_observed_at":"2026-08-05T21:24:06.186484Z","title":"Step-video-ti2v technical re- port: A state-of-the-art text-driven image-to-video genera- tion model.arXiv preprint arXiv:2503.11251, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.186484Z"},"links":{"cited_paper":"/paper/2503.11251","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:297aecd7b4e072132bc4e11d184ce73bc62ad2c40ad5471cf7d04e766c64a889","observation_id":"5fa83f4b-3bcc-4a19-bffc-ba006d6dbe76","resolution":{"observed_at":"2026-08-05T21:24:06.186484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:11.164628Z","title":"The accu- racy of psnr in predicting video quality for different video scenes and frame rates.Telecommunication systems, 49:35– 48, 2012","venue":null,"work_id":"e041ac89-3c65-48ee-903a-366bef5e9708","year":2012},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.279489Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a5324dbae7b1b21a9add49eb1963c092224ecc702f07a1fec68cf5267619ba5a","observation_id":"6471fbcf-7a4d-4bf6-921e-b3a5270daf23","resolution":{"observed_at":"2026-08-05T21:24:11.226142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-12T13:11:55.603094Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-05T21:24:06.340492Z","title":"Sonic: Shifting focus to global audio perception in portrait animation.arXiv preprint arXiv:2411.16331, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.340492Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a6996563d732eeca6595db54a048f3dae1a434e69aa565e57c0d35ef85b1f13d","observation_id":"e54293de-0b29-48d9-924f-b7446fb7133d","resolution":{"observed_at":"2026-08-05T21:24:06.340492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-12T22:51:36.940485Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T21:24:06.431313Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.431313Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:b62013e712edb7d9d5b8fda4cb7fc270661ae403a90b1e76a5fce4a82b7dc228","observation_id":"80926fae-08ce-4f87-9008-0757494756b5","resolution":{"observed_at":"2026-08-05T21:24:06.431313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.953696Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"69766f49-85d6-4980-80bb-bbde5b1fd652","year":2021},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.551175Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:acd8fb6c7c51be9925ea2a4351edf95ca88fadcb8e886e2d2d701906fb88b760","observation_id":"893ea3b1-3f2f-4b33-880b-bca847ba4a81","resolution":{"observed_at":"2026-08-05T21:24:11.048008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T21:24:06.688755Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.688755Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:e2163514ac56a147cd8a21335ac63da273cb513111a0cbe14877bdb3e6fce167","observation_id":"994d9fab-d6d1-4b4d-8c98-01ac622ec4b9","resolution":{"observed_at":"2026-08-05T21:24:06.688755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.789361Z","title":"Luma ray 2 video model.https : / / lumalabs.ai/ray","venue":null,"work_id":"01ae36a1-e32b-4b78-acde-94198e0dfaa9","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.807169Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:052ed9d7b80efa3e2ee4f06d3dd50c8c8112d3fa4afb1255a15e5649af7e5ace","observation_id":"27d6c694-364a-4966-928b-b35d9c2e7396","resolution":{"observed_at":"2026-08-05T21:24:10.854778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.615893Z","title":"Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,","venue":null,"work_id":"9194311b-8e28-4727-a3f0-d98cfdacfa41","year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.887819Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:1d0fb5a28c484cf479a98c0de4768de38d047d1fec6eb519308f1e9a351fb3c4","observation_id":"8bcc75af-195b-48d1-bd86-58844b0ad169","resolution":{"observed_at":"2026-08-05T21:24:10.700967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-14T04:53:10.712854Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-05T21:24:07.088948Z","title":"Latentsync: Au- dio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.088948Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:38224c171428ccd8dcbf9068575d41ee506eb35d9b1b1d77cff136c2e77402a0","observation_id":"98cb3211-2ac2-4a1d-8998-c10475b07b4b","resolution":{"observed_at":"2026-08-05T21:24:07.088948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-08-14T03:23:11.906355Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-05T21:24:07.155337Z","title":"Videogen: A reference-guided latent diffusion ap- proach for high definition text-to-video generation.arXiv preprint arXiv:2309.00398, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.155337Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:99317594b71fca13da688dab0a516d933eebbe16467bbeaf83c8d10b0f000828","observation_id":"57901d56-65ea-4a19-9d9f-23e6f2a6ce66","resolution":{"observed_at":"2026-08-05T21:24:07.155337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.267309Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"4d905cf5-1ffc-466a-9bc9-a77a65deed28","year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.257087Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:aef26271f28c788f55e17fd0ba3465fab26f757532f36fdbc837fca4cc3e5afe","observation_id":"57d2b5d0-0628-4f84-b681-3eafd24e774d","resolution":{"observed_at":"2026-08-05T21:24:10.374361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:07.313868Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.313868Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:55d2a94a5d9c9a4af538f1f7f86e4b47eb434a6b739cf2bed8ddd0930636eec7","observation_id":"8685b4a7-33cc-4bf9-98ef-1e5cffc6b000","resolution":{"observed_at":"2026-08-05T21:24:07.313868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10922","last_updated":"2024-03-15T08:48:04Z","snapshot_observed_at":"2026-08-13T14:40:20.483883Z","submitted_at":"2022-08-23T12:49:01Z","title":"StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation","version":2},"cited_work":{"arxiv_id":"2208.10922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.10922","snapshot_observed_at":"2026-08-05T21:24:09.304578Z","title":"StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation","venue":"cs.CV","work_id":"930c6515-2df9-43c1-8fd1-d84decc080d0","year":2022},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.379667Z"},"links":{"cited_paper":"/paper/2208.10922","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:130466e2abab3547c5664243a56184d5144d63a8e7fa6deeb37c53996c1d03cf","observation_id":"c88e2b08-679f-473c-a951-557d39ae9b46","resolution":{"observed_at":"2026-08-05T21:24:09.334830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-11T23:38:12.766811Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T21:24:07.462449Z","title":"Open-sora 2.0: Train- ing a commercial-level video generation model in $200k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.462449Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:ef5ccc5acd22d42c77fe3b05abfe6d01ecd468637b2994cd42da450721092736","observation_id":"9da70060-4f55-40ab-a22f-0f3d457aee67","resolution":{"observed_at":"2026-08-05T21:24:07.462449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.051363Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"3808144f-90d0-4d9d-bfd0-c7268d40a51d","year":2020},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.587910Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:027c2451b1f2f922bdb935134e04b295aa2a2068adcba9e4b1d1dbe1995cab08","observation_id":"b7948f18-721e-4235-828d-3ad5a26b8791","resolution":{"observed_at":"2026-08-05T21:24:10.148523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08714","last_updated":"2025-07-27T04:08:12Z","snapshot_observed_at":"2026-08-07T17:17:37.868071Z","submitted_at":"2025-03-10T08:38:25Z","title":"Versatile Multimodal Controls for Expressive Talking Human Animation","version":4},"cited_work":{"arxiv_id":"2503.08714","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08714","snapshot_observed_at":"2026-08-05T21:24:09.120511Z","title":"Versatile Multimodal Controls for Expressive Talking Human Animation","venue":"cs.CV","work_id":"3a4caa75-a7e2-4145-8b3e-fbfe19f61800","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.672135Z"},"links":{"cited_paper":"/paper/2503.08714","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:5c7d9af4e93e00150317395595f3e50b0fdbb9a47ad671a9a9e95e01bcc18eb8","observation_id":"67dfffa3-33ec-4b33-a529-05935706537a","resolution":{"observed_at":"2026-08-05T21:24:09.176859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-10T13:10:46.349703Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-05T21:24:07.747573Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transform- ers.arXiv preprint arXiv:2502.10841, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.747573Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:cf51dfc2ebe0621a0da0d11e2250ba42339059f0f2c31ace2a1a88fbf534cc93","observation_id":"5101bf6c-1045-4805-b9a0-3fa55900749e","resolution":{"observed_at":"2026-08-05T21:24:07.747573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:07.813333Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.813333Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:c2627b6330731d65bd66d05516c97041c690051c12ec6f155c82ef8f56e941fd","observation_id":"8f735ff8-6cea-431c-bd36-ad67c6eb923c","resolution":{"observed_at":"2026-08-05T21:24:07.813333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T21:24:07.908609Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.908609Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:f240ed310483abd9b3b9dbac582de8563b08bef065825871d9d57a1f561aa626","observation_id":"aeca28fe-9986-42bb-a0a5-5681bdb3fc2b","resolution":{"observed_at":"2026-08-05T21:24:07.908609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:09.855908Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":"2ea6b4ab-baaa-4617-ab27-e83f9a81519c","year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.986728Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:f37e743a77579f64ca0a08b2d74e61b65c2d46d9fa5a82b399ee0be79d3f0605","observation_id":"cd24ca58-02cc-4f59-afc6-e10a8b08301d","resolution":{"observed_at":"2026-08-05T21:24:09.922883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.082383Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.082383Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:99c1b00c3443a897af88b555c5e7bb54a805d9a1701968cb5ed942354c5c3a2b","observation_id":"5a0d1fb3-327d-4405-8d2e-8cd94feae4db","resolution":{"observed_at":"2026-08-05T21:24:08.082383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17697","last_updated":"2024-11-27T07:39:20Z","snapshot_observed_at":"2026-08-12T15:54:01.295306Z","submitted_at":"2024-11-26T18:59:22Z","title":"StableAnimator: High-Quality Identity-Preserving Human Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17697","snapshot_observed_at":"2026-08-05T21:24:08.163993Z","title":"Stableanimator: High- quality identity-preserving human image animation.arXiv preprint arXiv:2411.17697, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.163993Z"},"links":{"cited_paper":"/paper/2411.17697","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:f7b80827688fb0cec9047f29a0f607e5f08df01aa6258662271b53416a9205fe","observation_id":"cf2d0577-8566-4b21-bb82-73ba931ad1ae","resolution":{"observed_at":"2026-08-05T21:24:08.163993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T21:24:08.229848Z","title":"To- wards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.229848Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:447383b2b4fe9f754d8f616caa65c51eb780786b540c316ebd71763b365bdb9e","observation_id":"42b3d4fe-6134-4f02-b366-e5a92e2e859a","resolution":{"observed_at":"2026-08-05T21:24:08.229848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T21:24:08.292449Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.292449Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:8c62cc2b7ee7b13c793ab477a925ef06318c9e15a6eaeb7406b6de0dff9158a9","observation_id":"fc65f202-0682-40f7-ace3-c363d5aed292","resolution":{"observed_at":"2026-08-05T21:24:08.292449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:09.696544Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, pages 1–20, 2024","venue":null,"work_id":"209d7f3a-d96c-45f0-8e1b-dd6b8d4125b1","year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.373562Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:22dfe79485f4c4415c0e9542d0b183bde30be5008156fce6333757f5b7f31cb5","observation_id":"3182e70d-7162-457e-a16b-6345e95beead","resolution":{"observed_at":"2026-08-05T21:24:09.761627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.460168Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.460168Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:fe1f31936ad3330d96c71cd645328a3733f41ad8480631ab62af9f242a3b86bd","observation_id":"f3bcd8ed-ba27-4c22-85a8-309c428e58a6","resolution":{"observed_at":"2026-08-05T21:24:08.460168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.543292Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.543292Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:242233cf3b593b217e499aab631f0aa8741ba1572c15089a36f71f953457feb6","observation_id":"6e2d9b1d-8293-4304-a815-28494b7920de","resolution":{"observed_at":"2026-08-05T21:24:08.543292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T21:24:08.608636Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.608636Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:cc7e0331ab9796d59ec6b1b075774a170e203514d3b3df454416610887a39c7b","observation_id":"d6d1aa7b-b701-498d-aa61-9fe116bdff55","resolution":{"observed_at":"2026-08-05T21:24:08.608636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-05T21:24:08.669726Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.669726Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a9f6bfe70448da699c8975e8fbcb9917bfb0e461fe992d9c4234db40d3ea03da","observation_id":"adcbc9e8-b530-4c38-8aea-e0c81a9ad333","resolution":{"observed_at":"2026-08-05T21:24:08.669726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.721929Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.721929Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:e4d6e67693f628f3e2a34146cbc5e395ecd4965f167655b68832dea268e0821c","observation_id":"d0689d79-1e84-4c1b-b2cf-a75876eef380","resolution":{"observed_at":"2026-08-05T21:24:08.721929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.487674Z","title":null,"venue":null,"work_id":"e24430f5-50bc-40e3-80a4-9ad38fa4f56e","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.990235Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:57b81f7e8989e1e62c9ccd149dcb3deb8d58781221da2d087913037f62a36177","observation_id":"22c0ad9a-3c42-4827-90bf-7a15d8360f3d","resolution":{"observed_at":"2026-08-05T21:24:10.530104Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:41:21.813549Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":27,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2508.08891."}