{"as_of":"2026-08-14T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:107e1a46d38277534cc1977c7b04fb5e019acc8710b26d289775797355491ac1","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:43:27.553611Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:01:54.160626Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:13:27.684326Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"cited_work":{"arxiv_id":"2508.06511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06511","snapshot_observed_at":"2026-06-29T13:13:27.684326Z","title":null,"venue":null,"work_id":"5621056b-1037-4398-bdd8-33367b7f6978","year":2025},"citing_paper":{"arxiv_id":"2605.28056","last_updated":"2026-05-27T07:02:31Z","snapshot_observed_at":"2026-08-13T12:28:26.717983Z","submitted_at":"2026-05-27T07:02:31Z","title":"CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:03:27.312548Z"},"links":{"cited_paper":"/paper/2508.06511","citing_paper":"/paper/2605.28056"},"observation_digest":"sha256:4fbd2df52b5ac0010047712f38b1cd17a369d86e7b8ba2e9c841047c02b2791d","observation_id":"d773345f-2744-4f8c-a9d3-c70dc31562d1","resolution":{"observed_at":"2026-06-29T13:13:27.685726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06511","snapshot_observed_at":"2026-08-02T01:01:54.160626Z","title":"arXiv preprint arXiv:2508.06511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16339","last_updated":"2026-07-22T03:14:53Z","snapshot_observed_at":"2026-08-14T00:04:25.859766Z","submitted_at":"2026-07-16T10:49:15Z","title":"LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T01:01:54.160626Z"},"links":{"cited_paper":"/paper/2508.06511","citing_paper":"/paper/2607.16339"},"observation_digest":"sha256:47fe23b046bdfd8224e1ca0e1dde04d197676307043ba7d23e6ea5c3167afeb0","observation_id":"be47e19f-0ab2-41bd-8864-6cb4b794748e","resolution":{"observed_at":"2026-08-02T01:01:54.160626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06511/citation-record","integrity":"/paper/2508.06511/integrity","json":"/paper/2508.06511/citation-record.json","paper":"/paper/2508.06511"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.672923Z","title":"Spatio- temporal energy-guided diffusion model for zero-shot video synthesis and editing,","venue":null,"work_id":"794507b9-cdfc-4257-b9c2-05a4dace91dd","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.438409Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:ffbbefae18d2d666ed8b2b1341e87166c62d8099fc10c562471062c7c99ddfa8","observation_id":"23e7f1ae-2355-4938-bc93-9c8cc521c53c","resolution":{"observed_at":"2026-08-06T12:43:38.779195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.469945Z","title":"Tvg: A training-free transition video generation method with diffusion models,","venue":null,"work_id":"0b89b8f2-5cc2-4b64-a15f-fa596826cd64","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.607686Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3e5c5f85d949e831075e342c46bd3a088d81e6a5ce94904c25feb835fa9505a1","observation_id":"61d0c4ad-4374-47cc-be30-e068769bfe9b","resolution":{"observed_at":"2026-08-06T12:43:38.565940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T12:43:20.763128Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.763128Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:b5dfd072cd8fba561e659d3182beebfa595f5c424b812c06c9139985aa1fa717","observation_id":"0d1cd090-bf90-4703-a118-f3a4e125a3dc","resolution":{"observed_at":"2026-08-06T12:43:20.763128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.289446Z","title":"Corrtalk: Correlation between hierarchical speech and facial activity variances for 3d animation,","venue":null,"work_id":"a1e657ae-cfe1-4c5a-99b0-44b83270499b","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.872571Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:09f84296a0d75d414a4f75bd5044b4aae6cb1ff2ccbd3874c82f6991efbecc28","observation_id":"76b08039-2173-4305-a945-c8532ab21bea","resolution":{"observed_at":"2026-08-06T12:43:38.365671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.103807Z","title":"Wonderjourney: Going from anywhere to everywhere,","venue":null,"work_id":"cc247f20-38a0-4173-9aad-73decadbee67","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.959506Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:53993fdc219e122e0e420c10dc04bd6daeb5385febf3a30e7b68f5e3134db0b8","observation_id":"15db9d35-dc96-49b4-b9bb-608b5e91ebef","resolution":{"observed_at":"2026-08-06T12:43:38.228910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.900775Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models,","venue":null,"work_id":"86db5732-9777-42c5-810c-3da367b9d707","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.076719Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3964122a8e0ea8ac66c8a553c9004f7a98dcee0e9b96d49222ee45faa46bbab7","observation_id":"ac4c71df-2336-42b2-87ca-4dfcb924d932","resolution":{"observed_at":"2026-08-06T12:43:37.998274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.715367Z","title":"Audio-semantic enhanced pose-driven talking head generation,","venue":null,"work_id":"c4bdd63a-42d2-40a7-bccc-d6bcf41c8853","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.154548Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:873ad7a7f9fd65a7a58d542ea3f99ce6ba8e7fe91343faee0212392cc704a281","observation_id":"a84b4c09-8d90-4c46-b4de-15bb8d934705","resolution":{"observed_at":"2026-08-06T12:43:37.769317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.516685Z","title":"Alleviating one- to-many mapping in talking head synthesis with dynamic adaptation context and style adapter,","venue":null,"work_id":"a53783de-2dce-480a-8435-5935faed5608","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.325531Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3e45bf2d44ff0c1f8be364462ac59eefbc86b10624f4079ab5eb4de54ea59577","observation_id":"b29b8937-4508-40fc-9517-030d68a8c97b","resolution":{"observed_at":"2026-08-06T12:43:37.587619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.350250Z","title":"Stochastic latent talking face generation toward emotional expressions and head poses,","venue":null,"work_id":"62c3d28d-7fce-473f-8436-0c8bb0e1608e","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.435507Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:0c68c0ab38a2ef80927cb0bdebbaf184c8e34dee42a903ed65a5df6721b365cf","observation_id":"76152d6b-50ad-45db-a1ca-01b56ee10fb1","resolution":{"observed_at":"2026-08-06T12:43:37.403599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.158797Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation,","venue":null,"work_id":"220e6a6b-dcbf-4c05-ae38-ee9a28aa1253","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.543133Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:0adcd15968b18355362067cdbe3462db3ad3b5ada18d307791b75f3508db6795","observation_id":"d19d0b5e-9631-4218-a31d-96a41128f5e8","resolution":{"observed_at":"2026-08-06T12:43:37.249313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.995490Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"6890ddab-a6cd-4d3c-8198-6c3fbb9e9618","year":2017},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.646913Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:dfacd098c3e8243b9d29836a9c7a0ad25932c5d7e74435d51c3e144179f1d15e","observation_id":"452e0136-51ca-4206-a242-b16880eb494e","resolution":{"observed_at":"2026-08-06T12:43:37.073999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.748616Z","title":"Styletalk++: A unified framework for controlling the speaking styles of talking heads,","venue":null,"work_id":"3192da88-a96c-4c9c-bfef-e4ae91438090","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.773061Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6fa645b868d600fc9a9643996bd81ed619943b5f511d892e4bfc6a22361c3860","observation_id":"d97cfdfd-9130-4f64-aa87-18fec9500e84","resolution":{"observed_at":"2026-08-06T12:43:36.881020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.556547Z","title":"Multimodal inputs driven talking face generation with spatial–temporal dependency,","venue":null,"work_id":"ebbe7261-2d58-4fa5-b28d-229ece3ea19e","year":2021},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.885332Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:c176c34d8ba6cfacf973fa20a55121ef0e424ed6fe6431d4bf2275187f0e9e2c","observation_id":"1788aa76-1a4c-4014-80e0-d6f57b38682f","resolution":{"observed_at":"2026-08-06T12:43:36.666264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.350856Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":"d9a4d4c0-0f2b-4d61-8dd2-cfab5316a341","year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.054746Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:72eea7ec21486c554feaa21436d9657085f2e5b2a5c44df0a03908ad86a4e2a2","observation_id":"6d903a5b-71d8-4679-b2f9-6a477f61c1e7","resolution":{"observed_at":"2026-08-06T12:43:36.466007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.166030Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits anima- tion,","venue":null,"work_id":"adf84aa3-7816-43e6-979a-d69ace23f849","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.113727Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:aa87cf2ad94e5da76f96d50cfb3aa6207c0b88dba550cd389919800039422735","observation_id":"6d23a5b6-e5de-4f06-b5a4-c1ed4db6f079","resolution":{"observed_at":"2026-08-06T12:43:36.226831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15758","last_updated":"2024-05-24T17:53:54Z","snapshot_observed_at":"2026-08-12T23:58:33.088330Z","submitted_at":"2024-05-24T17:53:54Z","title":"InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15758","snapshot_observed_at":"2026-08-06T12:43:22.208132Z","title":"Instructavatar: Text-guided emotion and motion control for avatar generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.208132Z"},"links":{"cited_paper":"/paper/2405.15758","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:f0be972aebe703c9301a2ed22912540dc4c74810b49d848d882c0fae40469c27","observation_id":"717e74f8-781b-4d37-8072-472b6c6aad71","resolution":{"observed_at":"2026-08-06T12:43:22.208132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.965075Z","title":"Moee: Mixture of emotion experts for audio-driven portrait animation,","venue":null,"work_id":"685413c0-309d-44e2-b4b4-79f9219d27f4","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.291883Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:88c793e8e2b96f10290e41a7c87725049e98d2f1ba8e31a67ff4165f297e92b8","observation_id":"88dafea1-90d0-4a4f-91e9-b5bf13a1187e","resolution":{"observed_at":"2026-08-06T12:43:36.088689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.763514Z","title":"Face recognition based on fitting a 3d mor- phable model,","venue":null,"work_id":"c16703e9-7a0c-412b-9df6-278be55a23e6","year":2003},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.352937Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:035e73fb0e0c675bc857bb2d1620b7d2b7c638d37b79716ce55cd613447096ac","observation_id":"d38c91a5-5f69-4b5b-a381-49458102688f","resolution":{"observed_at":"2026-08-06T12:43:35.845916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.590377Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditioning,","venue":null,"work_id":"283224d9-6c7d-40db-9a8c-2d0a621f301f","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.461146Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:0b4584ae60a67216e2ef715d1b0601101bf5fba48d23ea3ec3d5f8197d5fc850","observation_id":"35c75f7c-e5a3-489b-8dce-e3561e78b74a","resolution":{"observed_at":"2026-08-06T12:43:35.645001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.376602Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with diffusion transformer networks,","venue":null,"work_id":"4b964074-3f79-4b38-b0a1-0fff816bb48a","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.572249Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4a9be1a7db62125c3dcc5fce1bd9b37d500321ef3249886003f44ab98c820dcf","observation_id":"b95cff9c-01c3-4fe1-92c9-21f702ab2b5e","resolution":{"observed_at":"2026-08-06T12:43:35.470591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.204457Z","title":"Styletalk: One-shot talking head generation with controllable speaking styles,","venue":null,"work_id":"4a6f3513-b734-43ca-87aa-0de94d320d31","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.625988Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:2edc5ef7184b15887e3cc0696e9c6f0dd7802637babf760572714bee52664c3c","observation_id":"791123d2-719c-4b7b-9375-4d5aab3d8325","resolution":{"observed_at":"2026-08-06T12:43:35.296235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.957060Z","title":"Style2talker: High-resolution talking head generation with emotion style and art style,","venue":null,"work_id":"1465bc4f-9e28-4c55-b9a0-75e0db7de13e","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.709334Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4d21e6355bd355ae0db2bd9e03616cb6e8f905f6678dba317610106d50f53e15","observation_id":"d8ebe8a7-1bc3-4514-86e7-30e255eb9b84","resolution":{"observed_at":"2026-08-06T12:43:35.101665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.771198Z","title":"Edtalk: Efficient disentanglement for emotional talking head synthesis,","venue":null,"work_id":"fe80ef9e-41dd-43b3-a731-00751fc4a2d0","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.797427Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:364497f6204067418a8e18dac04a5bf0737a5417356c7b5b0c3e50bc0ac8c49b","observation_id":"0dbb7566-bc70-4c97-a2e8-b83e276edda7","resolution":{"observed_at":"2026-08-06T12:43:34.858085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.573128Z","title":"Say anything with any style,","venue":null,"work_id":"9f2f20fe-97c6-45b4-a7e3-92df703822a5","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.909984Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:392d91c62874bc4385fed8f595b291eb9d555e8b138592577f94fa7e2cce09d4","observation_id":"c14acd06-90e2-43af-a9dc-f3c400550026","resolution":{"observed_at":"2026-08-06T12:43:34.701760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.402617Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions,","venue":null,"work_id":"733a6e86-d454-4e68-bd03-bf3892e9ed9c","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.942861Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:648f3e0ce642a0188b4c2a0fe9b5c101cd14e84b7c855431b64eeee6f2faf026","observation_id":"0d175107-6644-4bba-96a0-2bc4906775bd","resolution":{"observed_at":"2026-08-06T12:43:34.476957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.247879Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation,","venue":null,"work_id":"a35bab86-e0e4-41fe-bf07-c60856b225fc","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.033694Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:1b422572dfd7294a21ba21c70025a11a02b8796115e518b873f112ca059e2230","observation_id":"b24e3996-28ca-44c3-81fa-d4db7c263a02","resolution":{"observed_at":"2026-08-06T12:43:34.307021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.991979Z","title":"Real3d-portrait: One-shot realistic 3d talking portrait synthesis,","venue":null,"work_id":"c189b3ed-9274-4836-8f3c-f1fbe9c6cbe7","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.090722Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3ecb788349483e34ac81315268442f2dfebaca283e8860da4529e403c774acee","observation_id":"46cb5150-1c18-4cd5-a097-6fe6d9085ed0","resolution":{"observed_at":"2026-08-06T12:43:34.138099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.811005Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"d53adcc7-847a-4207-ba80-29964190db55","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.147505Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:5b07bc5671048b18b103af2e7cdbb9c2a453fb100cddd351c27baa9a134a74a8","observation_id":"7c348509-6106-48d2-b11a-2e557bc8570f","resolution":{"observed_at":"2026-08-06T12:43:33.907031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.662234Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer,","venue":null,"work_id":"e4fdb611-14d3-4e12-a421-9bc288b3a189","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.241228Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:ba2090e7cd77177985fef40bfcaf3e2f4f4076ffddecd5416349a89f8d51c26f","observation_id":"6c8df61a-d7fe-40cd-9420-e1bc79c41d92","resolution":{"observed_at":"2026-08-06T12:43:33.727718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:23.332696Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.332696Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:49dc01166659d5df0e926f000ea2a179fe5db1e421568237e9f982c91d30d40d","observation_id":"fd53d714-bd38-4778-b867-a7e1fb121158","resolution":{"observed_at":"2026-08-06T12:43:23.332696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.492075Z","title":"Efficient emotional adaptation for audio-driven talking-head generation,","venue":null,"work_id":"c3d96f45-1acf-4ca4-a955-2de539a2d707","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.427386Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:eafe4026ca696772da65621e38d4bcd4a962fc55489a616dd5a9d6e1c6dc2be4","observation_id":"64874710-1360-4236-96b1-bf5fe39e4031","resolution":{"observed_at":"2026-08-06T12:43:33.566500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.313537Z","title":"Talkclip: Talking head generation with text-guided expressive speaking styles,","venue":null,"work_id":"4287843c-1c0c-4ea1-a13b-08304e942f0c","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.500353Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4856d47cc67588a7c98238e9327b29fbe4537f66da9ee188ffc62d714665bce9","observation_id":"86f3dfd8-79ed-4ef6-b804-61215e02fe25","resolution":{"observed_at":"2026-08-06T12:43:33.404635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:23.589831Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.589831Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4e80a367297355ccab164a54618b6891f146e1a6ec63e0dbf4aa439ec16e0c6d","observation_id":"9faeff50-dbcb-4bb2-8b88-134aec1e951d","resolution":{"observed_at":"2026-08-06T12:43:23.589831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-13T00:44:42.973028Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T12:43:23.684599Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.684599Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3244baffc2803fa18ee661e1778e69213b71a7eb44f4c84b3dfd8345f7b29aae","observation_id":"499289a0-6f66-421d-af3e-61575593d220","resolution":{"observed_at":"2026-08-06T12:43:23.684599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-12T23:43:58.009316Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T12:43:23.782760Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.782760Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:2addf57b5462cc578169b40b099f67a69c97211591e7baebd9ebaf51b797ad48","observation_id":"9da71d78-ef20-4e73-bb0d-8d84202ec70f","resolution":{"observed_at":"2026-08-06T12:43:23.782760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.180753Z","title":"Rep- resentation alignment for generation: Training diffusion transformers is easier than you think,","venue":null,"work_id":"1578e0c0-d735-4b54-9c58-c86d8ed9b974","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.845045Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:cdb326e290467907f340728f7040ebb918293236d0e92f76ec00fefc6bb48d77","observation_id":"85e08829-a9c3-4242-8017-f0cb3d426677","resolution":{"observed_at":"2026-08-06T12:43:33.244426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.955335Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":"3fcd38a9-536d-43d5-9627-0ccb097f9081","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.915048Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:7f1c17bb83bb1920f5130bc7a9f63ec40299975518d2f421c78f57ed37abf7f1","observation_id":"73f9ec82-391c-47bf-95dd-a89513ed5f6a","resolution":{"observed_at":"2026-08-06T12:43:33.038179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.726797Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":"44ee20c4-cb4f-45f1-9873-55ee74ae2214","year":2021},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.985124Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:27a47a91031106c8b18240bb378d0c19d9b0340abb306c3731de994ec1256124","observation_id":"0c8471b9-20c6-470d-bb11-dddd135e1d93","resolution":{"observed_at":"2026-08-06T12:43:32.847464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.528512Z","title":"CelebV-HQ: A large-scale video facial attributes dataset,","venue":null,"work_id":"fc7862c3-0742-47cd-b1a0-e8e1334496d5","year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.080905Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:288ed48d3e4ba0715cf783659a219dbe19b35ef8626c366132747bc64a512eee","observation_id":"8be51ba6-c19e-4c1e-a37d-b2156889883f","resolution":{"observed_at":"2026-08-06T12:43:32.636580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.362496Z","title":"Hierarchical feature warping and blending for talking head animation,","venue":null,"work_id":"1dc59289-2aae-4cd1-bbc4-9cdb0fd2f445","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.238790Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:49e77714eeac467ed605223974d3cf1523af83bb0d9d9c78347b83e1c96488d9","observation_id":"fe30ef19-9d24-4883-be37-144cd3bed17a","resolution":{"observed_at":"2026-08-06T12:43:32.433129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:24.356376Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.356376Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6ccbb62bd58239696cd2779af148973139a689850c565c9482d0f5879fa2b712","observation_id":"75d24d69-e53d-4113-a87b-be33cd9f0c26","resolution":{"observed_at":"2026-08-06T12:43:24.356376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.184565Z","title":"Diffused heads: Diffusion models beat gans on talking-face generation,","venue":null,"work_id":"84060b86-513e-409d-bdef-de426b3539b2","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.523648Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6fad2cf9b75f16c7a27972ff5e6637bbec0d97a678a102adf8bfa9d8366febc7","observation_id":"7a07d779-5799-4c25-bbcc-a72fdf3677c9","resolution":{"observed_at":"2026-08-06T12:43:32.261330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.008911Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency,","venue":null,"work_id":"d1caf9bc-ede8-46b9-9877-f866b38874a6","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.615081Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:246411bbe342a25138884d586ef86df94701ae5cc2c9e1a7a35504b610f8fa5f","observation_id":"e1da9b9c-3384-4687-9fd7-cb1f31ca2b0f","resolution":{"observed_at":"2026-08-06T12:43:32.085060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:24.682758Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.682758Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:82dc4937ceeec6635a3437902be37732306fff9c0f2afbac5f1e9e24525d1048","observation_id":"977c85de-1616-4d4b-978d-883bfa9f98d4","resolution":{"observed_at":"2026-08-06T12:43:24.682758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.764701Z","title":"Efficient emotional adaptation for audio-driven talking-head generation,","venue":null,"work_id":"516896d3-4a85-4439-84d6-36fa5528da80","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.780806Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:0030ea8670919b935a62d4037d22d4f2485aac5446b797fda6e07a144df811f2","observation_id":"ca2ad9aa-9256-48cc-b7c2-f94119409e40","resolution":{"observed_at":"2026-08-06T12:43:31.863138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.570352Z","title":"Emmn: Emotional motion memory network for audio-driven emotional talking face generation,","venue":null,"work_id":"fe04dc10-a71f-4095-8437-8e43abc17dd6","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.877887Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4c0f85a87fa24599fc9e00ff325b970f88ac7b9c47e0fcabc262e87537ded8e4","observation_id":"bbde5224-6056-47f0-aa05-f09de5ef64a0","resolution":{"observed_at":"2026-08-06T12:43:31.669046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.357574Z","title":"Talking face gener- ation with audio-deduced emotional landmarks,","venue":null,"work_id":"388f0bbe-2211-49f4-892d-002f3f5322ff","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.940996Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6ac58aa75892caf3d89b0e7f313609a655cd5039d8bfc8d31368112ce9d657ae","observation_id":"001f16cd-4748-4652-a42f-0e9d09616507","resolution":{"observed_at":"2026-08-06T12:43:31.452342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.213163Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model,","venue":null,"work_id":"11e90fae-38d4-469f-bf5a-721f913d2d60","year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.046119Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:2e9c19e2a7000ddbd9b3b7cdb021ad3bc59e61f2384532e57a6ed8319e77080c","observation_id":"82de0386-a1b7-4c06-8e82-c8e3a89ccabe","resolution":{"observed_at":"2026-08-06T12:43:31.294588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.988268Z","title":"Neural discrete representation learning,","venue":null,"work_id":"c02bd96b-9b62-4361-b09f-d588dd2fdc68","year":2017},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.180962Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a76947ae05c028987cca2c3c1bafa76269087a8a87ef3e9766f80cbe469f9703","observation_id":"e06e0b86-af4b-4930-8ac4-68a5f866dc0d","resolution":{"observed_at":"2026-08-06T12:43:31.103654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.795741Z","title":"Progressive disentangled representation learning for fine-grained controllable talking head synthesis,","venue":null,"work_id":"3000b81c-d0ee-41a0-abc6-531292df24a1","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.288675Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:2294756ea23798b6c850d2d1f50626d49c470c96ce00101f4d72a89eddbf2e73","observation_id":"1df25f53-5755-424b-b07b-c463d8e2d844","resolution":{"observed_at":"2026-08-06T12:43:30.839573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T12:43:25.371332Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.371332Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:e1f660e0527000da592caae62faaa5b89f4f156efecc64dfbcc3fcdb26d37be6","observation_id":"4841976a-bf37-4262-a744-c86f37d48914","resolution":{"observed_at":"2026-08-06T12:43:25.371332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.585772Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation,","venue":null,"work_id":"f5009405-8a32-48ae-92b3-753f093e2643","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.473087Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9469e4e8a435e5ad1cbba1afc0317c1a29401092f78db9e84f82bbd3adeb1c3a","observation_id":"12e53d0b-d73e-49f8-9cd5-eaf8efb3e117","resolution":{"observed_at":"2026-08-06T12:43:30.685967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.370238Z","title":"Megactor- σ: Unlocking flexible mixed-modal control in portrait animation with diffusion transformer,","venue":null,"work_id":"53212c32-2594-4ced-82bd-b55574e34b01","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.616433Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6a19abede8317a8d0f9a3236f8b74bb490190ea2d7ac363cd8e979fd931a1a85","observation_id":"d8204951-6415-48ad-8c77-e803742d4b90","resolution":{"observed_at":"2026-08-06T12:43:30.479263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.179334Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time,","venue":null,"work_id":"079b8a70-6a14-4b9f-8d1b-17018c4b6633","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.797404Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:58413e0331ec31cf665e5c0c007337c3fbcc7049ad8a245753b7b7b7b26acab7","observation_id":"fedecec2-efc7-46d6-9efa-406140d0c4be","resolution":{"observed_at":"2026-08-06T12:43:30.267860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:25.877250Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.877250Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:e3be7f82ed2c740be3a21ca95e2359b10cd2c06d584702718a8d9e9564fac493","observation_id":"d810176f-352f-4331-9db9-d1a337d234a0","resolution":{"observed_at":"2026-08-06T12:43:25.877250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:25.953112Z","title":"Easyanimate: A high-performance long video gen- eration method based on transformer architecture,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.953112Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:1debee24398dac6bf8649a6c60e43d6dea76d5fc99d3f280ad45557754860c65","observation_id":"1395334b-d60f-4ab7-82ed-0b771d9c44b9","resolution":{"observed_at":"2026-08-06T12:43:25.953112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-06T12:43:26.010676Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.010676Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:d8042f299f81061869577a0e34d51c9fd3b02ba5719437c47eb78a2c67ed2d60","observation_id":"c4f017e6-91b8-4be8-aa3d-ed68e2a76e37","resolution":{"observed_at":"2026-08-06T12:43:26.010676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.995147Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"599b4913-6743-41b7-99ac-64edd2218958","year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.094954Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:075e7f52b3cf053711d2c0324f27b2248777aeb51af122258758416b72d58f0c","observation_id":"99c38c09-4ff1-48b9-b933-742b6633e492","resolution":{"observed_at":"2026-08-06T12:43:30.081629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.787215Z","title":"Effective whole-body pose estimation with two-stages distillation,","venue":null,"work_id":"9cd1c0b7-236b-4b45-b419-85ca0b7605b5","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.179445Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a26951fe00b098fde13cab287f7f85f848ad4be9d8575943bb2e0d568d01ecb5","observation_id":"07ce0a9e-4aa9-42c5-9f5c-51fbb3c3124a","resolution":{"observed_at":"2026-08-06T12:43:29.879551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.598366Z","title":"Stylecrafter: Enhancing stylized text-to-video generation with style adapter,","venue":null,"work_id":"7092c0ba-afa7-4765-a4e6-a6171ca4658b","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.283689Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4e1e730fa82001f64a6abe3a06e02589da25e080115c6cd591710c389de81b42","observation_id":"97dc7f49-0224-44b6-967f-5e19fca39027","resolution":{"observed_at":"2026-08-06T12:43:29.655657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.416103Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"60199ea8-285a-4c13-bd08-b2e8767ce049","year":2021},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.373131Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:edb27a38ab3dfaa05c6dca1d47f8362086e86b5749a5d1882114e55b0875fe74","observation_id":"b0e833b1-9f78-4b4d-97ba-b86315713c97","resolution":{"observed_at":"2026-08-06T12:43:29.491485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.237160Z","title":"Vision transformer with quad- rangle attention,","venue":null,"work_id":"45d17fae-bd43-4054-92fe-b0be78f3370b","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.457543Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:750fc4fca51b9d90e5b3c6def88fce0af1427f42d5dd25542e78b43d095845bc","observation_id":"0bc9ccad-1c30-45bf-bf48-2b8db2da1e75","resolution":{"observed_at":"2026-08-06T12:43:29.346309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.060940Z","title":"Celebv-text: A large-scale facial text-video dataset,","venue":null,"work_id":"c3accdf0-68f3-46c8-b70c-c3f5ed519d10","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.612613Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:5de9d3da9da0463da8150efae11bf298e9a2fb255f6cefe52b06388479ed717e","observation_id":"10ac8c89-d956-4722-8868-8d3baa0e54ed","resolution":{"observed_at":"2026-08-06T12:43:29.150137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07151","last_updated":"2025-07-13T07:52:42Z","snapshot_observed_at":"2026-08-12T22:39:51.114948Z","submitted_at":"2024-09-23T07:27:02Z","title":"DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07151","snapshot_observed_at":"2026-08-06T12:43:26.732825Z","title":"Facevid-1k: A large-scale high-quality multiracial human face video dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.732825Z"},"links":{"cited_paper":"/paper/2410.07151","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:dc4524a7976c9e51decd1ff97598e151485f313b21f850517f3bf5fc37406f1a","observation_id":"eb870c7b-82ee-490b-9c7b-310cc136010f","resolution":{"observed_at":"2026-08-06T12:43:26.732825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.850722Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":"d5c5bd19-fa1b-436f-b085-9f602eedfed9","year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.853076Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a5ac7635c852fe13ffbcc2dddbfc221faaee170617aa07569830bc8daf123283","observation_id":"cfad3b58-5566-457a-8896-b88f521e39f0","resolution":{"observed_at":"2026-08-06T12:43:28.940438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-14T04:53:10.712854Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T12:43:27.004117Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.004117Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:69e17ce7042b9493f380efcf36882ed88c6f583215b29d489e9e9df1dcd42719","observation_id":"74c75899-b98c-4529-acdf-2cdec7496d4e","resolution":{"observed_at":"2026-08-06T12:43:27.004117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.654812Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":"bb2bda06-6b00-4e00-abff-a736392f828e","year":2017},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.132662Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:fd1badf4312049835ddb2b2bf4d2b05405e1458ca2a5415e993e420874ca0f37","observation_id":"6d984e16-3249-45e2-a821-dcc5d65678b2","resolution":{"observed_at":"2026-08-06T12:43:28.758591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.447982Z","title":"Video-to-video synthesis,","venue":null,"work_id":"95c93e27-83d7-49c2-b166-8a0ba715b3f0","year":2018},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.290711Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:65fa7762af734155a9c8da0b7f23f50d2bce32174edfc1b7563de12cb9217b79","observation_id":"d756d998-225c-4e56-8b4b-280b72fec00a","resolution":{"observed_at":"2026-08-06T12:43:28.559570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.254147Z","title":"Ani- mating arbitrary objects via deep motion transfer,","venue":null,"work_id":"53781c95-2bd7-48fd-8128-c63efb991854","year":2019},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.374229Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:cd26cad246fe09ea8e5f8afd22f8937b663ffd30e36e260049b3fb229e2ad506","observation_id":"7db45693-961c-4dc3-afe1-336b58182499","resolution":{"observed_at":"2026-08-06T12:43:28.352098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.018422Z","title":"Seeing what you said: Talking face generation guided by a lip reading expert,","venue":null,"work_id":"f4f7f47f-b174-424f-a83d-761e9b18a072","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.454581Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9afe96bd8b3873933ddd013db94a753d4f4a67f9b4054957b9df64867319ecf6","observation_id":"fb8e6625-bf93-43b8-9a23-5b65c68f696c","resolution":{"observed_at":"2026-08-06T12:43:28.145129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:27.808480Z","title":"Towards robust blind face restoration with codebook lookup transformer,","venue":null,"work_id":"b35a21fc-1835-4c3a-8cf8-f6bee12db6ed","year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.553611Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:d7d24489f884ca936a00e915e964e6a1906718c6b0d91429a960c30ad95d3d9c","observation_id":"64953955-4a54-4cc1-a894-2bdbaeebdd65","resolution":{"observed_at":"2026-08-06T12:43:27.914596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":57},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2508.06511."}