{"as_of":"2026-08-09T14:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:334d09fcb44fd201aedf912e9c4e75140486595d63184dbcb2d1527607fec88c","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:38:20.590974Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.05092/citation-record","integrity":"/paper/2507.05092/integrity","json":"/paper/2507.05092/citation-record.json","paper":"/paper/2507.05092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:30.652663Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":"c6f07369-d0db-4810-a2cc-cacdca6ed1df","year":1999},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.430133Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:81cf7d5c46152dccde25a534581b2b0053e712b088a73ba59187e9aa9598d102","observation_id":"8cee1c3d-4d3b-4c04-bcf2-587a78f80c85","resolution":{"observed_at":"2026-08-06T19:38:30.736538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:30.367809Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":"166a3bcf-929d-4d84-af15-25cd1fe121ff","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.433575Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:b712b39058da40b963a37626cacb54da5458ba31b01e8500dcc9d77705f2368b","observation_id":"b4f8edd8-0cc6-47df-afb1-b065500818bb","resolution":{"observed_at":"2026-08-06T19:38:30.513004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02966","last_updated":"2017-07-18T14:58:55Z","snapshot_observed_at":"2026-08-07T20:50:54.148869Z","submitted_at":"2017-05-08T16:44:46Z","title":"You said that?","version":2},"cited_work":{"arxiv_id":"1705.02966","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.02966","snapshot_observed_at":"2026-08-06T19:38:20.977522Z","title":"You said that?","venue":"cs.CV","work_id":"20187ab4-81f5-46b1-b028-f5075d1c015e","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.437079Z"},"links":{"cited_paper":"/paper/1705.02966","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e764a8c26c31ffcc5fd65f121d4a9538c883e51279969d0e49d020ca90100dee","observation_id":"fc95a1b9-b64f-41a4-bf41-efd907fe8f5c","resolution":{"observed_at":"2026-08-06T19:38:21.116132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:30.084309Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"5a4a7784-21e4-474b-89e8-5270f9065aa8","year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.440540Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:9aa4f9a8f7c1ad851bf961bf02021ba9cbaa2b014c20b2c1f58dd5622f2aaeb1","observation_id":"b4d553b6-7fa0-4490-9a37-b2ebf5c3621f","resolution":{"observed_at":"2026-08-06T19:38:30.189584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:29.712645Z","title":"Accurate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":"bd006516-16d8-4f8f-9b52-31810f0efb11","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.443919Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:05136e1845a4a7bc0a1c03c35ad93815037370853f6e261f94c53083491e072b","observation_id":"23f4c44d-469a-4e9a-879e-8adeea596953","resolution":{"observed_at":"2026-08-06T19:38:29.858375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:29.420310Z","title":"Dae-talker: High fidelity speech-driven talking face generation with diffusion autoen- coder","venue":null,"work_id":"b61b62bb-4a57-4b13-8e6e-84cd59bd8495","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.446762Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:575bf5bc37a3b4751f97924c08d3f29d70d740ebcfed232f414d22e33ea07a54","observation_id":"1d9fa577-2ed1-4238-a56d-6653311e1b01","resolution":{"observed_at":"2026-08-06T19:38:29.574230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.449788Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.449788Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c352fad97cbf1004dc8e8e78e6048030ef660885ba8cbe4149ede9c59959d90c","observation_id":"d3848b8e-6786-49dc-92a1-bafbcdb3aedf","resolution":{"observed_at":"2026-08-06T19:38:20.449788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:29.039527Z","title":"Ad-nerf: Audio driven neural radi- ance fields for talking head synthesis","venue":null,"work_id":"66bbfd2a-abe4-4b59-bc08-c25d322db97d","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.452970Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:a0268251efdf2d60412fa16b6c0568bc127e5b657e93eebb1f41f12f06bb208a","observation_id":"5fe11f5c-a2a4-4837-a253-a6c786e08c48","resolution":{"observed_at":"2026-08-06T19:38:29.242496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:28.771897Z","title":"Facexhubert: Text-less speech-driven e (x) pressive 3d facial animation synthesis using self-supervised speech representation learn- ing","venue":null,"work_id":"49d81b4d-453a-458d-adb0-7bb77ed47d7e","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.455770Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:4e8c906cade9ec4558a4370bd33db1e1adab659c2b8362d16557dd1973d4a29f","observation_id":"03a3c0e8-84a5-4ecf-810d-a754cbdf8bd8","resolution":{"observed_at":"2026-08-06T19:38:28.887210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15230","last_updated":"2024-03-14T11:49:40Z","snapshot_observed_at":"2026-07-06T16:52:27.457437Z","submitted_at":"2023-11-26T08:04:43Z","title":"GAIA: Zero-shot Talking Avatar Generation","version":2},"cited_work":{"arxiv_id":"2311.15230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15230","snapshot_observed_at":"2026-08-06T19:38:20.780009Z","title":"GAIA: Zero-shot Talking Avatar Generation","venue":"cs.CV","work_id":"99e511e9-a851-4144-b1db-75ef1b65f18c","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.458871Z"},"links":{"cited_paper":"/paper/2311.15230","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e7ba912ef13ca127a0f6d6c7179660d83fc9ad23c0cbf53e7a59881916a7d6a4","observation_id":"7c1bd97c-5501-4a64-aa92-1ca5b3f01f88","resolution":{"observed_at":"2026-08-06T19:38:20.866922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:28.427212Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"ed2bc213-0880-4df7-b572-ba956e010c94","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.462422Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:580749cffde079af24bf08ec9a63f1d1b994d67c59d7780fcc3ada4c8900a0ed","observation_id":"f1a09b4b-2371-44f8-b2bc-3d9669cd06b6","resolution":{"observed_at":"2026-08-06T19:38:28.593769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:28.152471Z","title":"Implicit identity representation conditioned memory compensation network for talking head video generation","venue":null,"work_id":"1506dff5-2897-462c-b9f6-8dbdc348b721","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.465191Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:64045bf926106fa8d50f7964f4a9c107cdfcb2874fdeac8912e849e8d20a5414","observation_id":"0328e1ad-3b23-491a-b9fe-563c3d8b4f84","resolution":{"observed_at":"2026-08-06T19:38:28.281921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06225","last_updated":"2023-12-10T05:20:24Z","snapshot_observed_at":"2026-08-06T16:46:46.844238Z","submitted_at":"2023-05-10T14:58:33Z","title":"DaGAN++: Depth-Aware Generative Adversarial Network for Talking Head Video Generation","version":2},"cited_work":{"arxiv_id":"2305.06225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.06225","snapshot_observed_at":"2026-08-06T19:38:20.735193Z","title":"DaGAN++: Depth-Aware Generative Adversarial Network for Talking Head Video Generation","venue":"cs.CV","work_id":"7659fcd5-5e11-4d14-8e1a-0c14ecdc53e5","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.467907Z"},"links":{"cited_paper":"/paper/2305.06225","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:45ce4ff2905d9a00d29537bc5e26c90aa08071e1bc2820403073e8e447205bf5","observation_id":"fe1ef8fa-8c66-4cda-a6bb-dd4350f8f3f8","resolution":{"observed_at":"2026-08-06T19:38:20.756341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.883100Z","title":"Depth-aware generative adversarial network for talking head video generation","venue":null,"work_id":"b5ed1411-2d30-4765-9d6a-7c1a1f738d76","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.471010Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:0d826410fe338445044abfe5052804ee981deaf561a993ee9317e591a575bbb6","observation_id":"167f1b13-1462-49b2-9c92-1bc5f0dac928","resolution":{"observed_at":"2026-08-06T19:38:28.009063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02542","last_updated":"2025-04-07T09:32:46Z","snapshot_observed_at":"2026-08-07T16:11:41.005225Z","submitted_at":"2025-04-03T12:44:41Z","title":"Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02542","snapshot_observed_at":"2026-08-06T19:38:20.474478Z","title":"Audio-visual con- trolled video diffusion with masked selective state spaces modeling for natural talking head generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.474478Z"},"links":{"cited_paper":"/paper/2504.02542","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:8f7ebbe3ef3ed1a47179d687a124382fd526115f27676e6fda62c440ffbbe3db","observation_id":"aa640803-062e-4a2a-9704-f5eec816209f","resolution":{"observed_at":"2026-08-06T19:38:20.474478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.671004Z","title":"Audio-driven emotional video portraits","venue":null,"work_id":"6480d04a-73e0-433f-8d9e-336f43e27a96","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.481151Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:f65cb1af5366fc6b7e7c7ccfdf6fcf3e31088b4af25fb3c02c5d00f3d40aeaa6","observation_id":"84f58e79-35e0-4779-a77f-f2f8913b2b09","resolution":{"observed_at":"2026-08-06T19:38:27.781678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.415801Z","title":"Transformers in vision: A survey","venue":null,"work_id":"f1295e97-9d58-41d9-a667-ab54d84847b4","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.484001Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c673e86635ac7d885543d467ee5753d143f898bbac9f8a93dd180e3bc26ef662","observation_id":"8243d0ef-8a90-4b24-a7cf-e347d3ca4fa7","resolution":{"observed_at":"2026-08-06T19:38:27.506549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.132955Z","title":"Deep video portraits","venue":null,"work_id":"cea08fe4-30b0-486c-997e-1c9b1304bab5","year":2018},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.486816Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:08b2bbdc0d57b7b087f460feab8ed8d1117b60adf5f3f759b143f406b9c71cb6","observation_id":"d4d0c738-bfa5-4595-a262-3ad63505262d","resolution":{"observed_at":"2026-08-06T19:38:27.275743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T19:38:20.489513Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.489513Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d44cf6d203adac5e96cc7efb6ed579cbee704b451d9d003a388edba96b492319","observation_id":"b6204282-38eb-45d7-8ddf-72ca548fb991","resolution":{"observed_at":"2026-08-06T19:38:20.489513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03121","last_updated":"2024-05-06T02:32:41Z","snapshot_observed_at":"2026-07-06T18:10:08.416524Z","submitted_at":"2024-05-06T02:32:41Z","title":"AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03121","snapshot_observed_at":"2026-08-06T19:38:20.492669Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.492669Z"},"links":{"cited_paper":"/paper/2405.03121","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:4455cd22414985238ac0e9b0e95826e497bcc38e8c9c2614168349c0e9f5af72","observation_id":"e7716d64-440d-4cf7-8da5-33d4e7156fef","resolution":{"observed_at":"2026-08-06T19:38:20.492669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.903023Z","title":"Moda: Mapping-once audio-driven portrait animation with dual attentions","venue":null,"work_id":"da273209-df96-4525-a861-f8479cf55ac8","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.496048Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e716c79dd1139f83277ea2ae35f5c28b54f268e97777b92e7e158ecbdae6608c","observation_id":"6230e1cb-f0f8-44d4-910c-4e30cc395eec","resolution":{"observed_at":"2026-08-06T19:38:26.994177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.648822Z","title":"Live speech por- traits: real-time photorealistic talking-head animation","venue":null,"work_id":"12653d2b-1c1b-4351-bc5b-2239255cd940","year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.498870Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:3f950074c03e82a6a5abf274a1644e78adfe777ba05cc8dcf849500478c16353","observation_id":"cc2d224c-570b-4ae8-9600-2000bb2cc771","resolution":{"observed_at":"2026-08-06T19:38:26.776730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.345121Z","title":"Training strategies for improved lip- reading","venue":null,"work_id":"1c799fd8-39d0-4020-8a8f-fb8502151447","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.501957Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:58850ad400ff21e1433c7adf86a7bcde0891325e71d9f23e9bd55f4f34bcb090","observation_id":"602d3749-d771-43e3-9f6e-6b43b772e56d","resolution":{"observed_at":"2026-08-06T19:38:26.437494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-06T19:38:20.504641Z","title":"Dreamtalk: When expressive talking head generation meets diffusion probabilistic models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.504641Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:9cdbc93214aab33e8ca2dc6d2bdbb188dbb2f9d15a910327e5cc9a8e05318750","observation_id":"3d446572-f400-4b64-92f0-d6db6a9cd57a","resolution":{"observed_at":"2026-08-06T19:38:20.504641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05712","last_updated":"2024-02-08T14:39:16Z","snapshot_observed_at":"2026-08-04T13:02:13.622096Z","submitted_at":"2024-02-08T14:39:16Z","title":"DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05712","snapshot_observed_at":"2026-08-06T19:38:20.507706Z","title":"Diffspeaker: Speech-driven 3d facial animation with diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.507706Z"},"links":{"cited_paper":"/paper/2402.05712","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:41280ba533283f873cea52e208367eef03406edf7f91ac7489b44ec17dc9580f","observation_id":"9c2e43db-8b8a-431b-b31b-810aef76b4fc","resolution":{"observed_at":"2026-08-06T19:38:20.507706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.011003Z","title":"Librispeech: An asr corpus based on public do- main audio books","venue":null,"work_id":"362df8b4-2ae1-491b-ae7b-f617d1eb63a3","year":2015},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.510785Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d96131a5b1c12f20badf1329a40d33bd2bfb48e21f322444ffa218e5eb6bca36","observation_id":"0049d14a-a49a-4224-91ae-ef785403e837","resolution":{"observed_at":"2026-08-06T19:38:26.182893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.789829Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"4bcceff9-c077-4d25-9da9-0d26f56faeaf","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.513555Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:4c48b64c25f0cb41f581894d8efd811c5997faeecfe827cf26e3cf3da21cc0fb","observation_id":"66454920-a701-4407-b670-4873c58a61a8","resolution":{"observed_at":"2026-08-06T19:38:25.916830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.481996Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"7c5160f0-b702-4e85-a780-0c1dd7536bb7","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.516395Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:8516495676f1adfa78ba92f69211bb37df7425c41c87ca71b9a0cb723e5c1d75","observation_id":"4d84c517-e4cb-4281-bbe7-e67d57a618de","resolution":{"observed_at":"2026-08-06T19:38:25.657706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.519303Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.519303Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:77e840f33eadd02f736a32358fac3c07970972ca27927d5054e54912e0d4a265","observation_id":"90859342-df51-45a5-affb-1005a4294afc","resolution":{"observed_at":"2026-08-06T19:38:20.519303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.164412Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":"df52dc54-2a97-4732-92b2-6efd59b1db6f","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.522395Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d021d0a19d98f1c7bece8485517ce3774cc80c274e67e1c9d32cc96a8c72f78e","observation_id":"182a4583-fc6d-40a7-98af-a6d4a49ca6cb","resolution":{"observed_at":"2026-08-06T19:38:25.321835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.883624Z","title":"First order motion model for image animation","venue":null,"work_id":"cc44ac62-7382-47dc-8bff-25febc7054d2","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.525008Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c99b0cdafd97eee432b8254584187d221378e0f8be424ead17d0b7b3f89ee61f","observation_id":"eab7c841-fa7b-4c58-96b0-e37a38906e01","resolution":{"observed_at":"2026-08-06T19:38:25.005868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T19:38:20.527573Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.527573Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e5231328c7c7cd524994e820ad12239d1a4da23b35eac3d9d4ddfc7d4ca5cd0e","observation_id":"6b328f7e-e45c-473a-b45c-e6a49c2fb524","resolution":{"observed_at":"2026-08-06T19:38:20.527573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04786","last_updated":"2019-07-25T20:40:22Z","snapshot_observed_at":"2026-07-06T06:33:13.437664Z","submitted_at":"2018-04-13T04:19:52Z","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04786","snapshot_observed_at":"2026-08-06T19:38:20.530316Z","title":"Talking face generation by conditional recur- rent adversarial network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.530316Z"},"links":{"cited_paper":"/paper/1804.04786","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:3a5c12010dc535104ae47a0deb42ef9d392dadf2272cb45f76266650973dffa5","observation_id":"db8b93ee-57c1-445e-8a74-f7e50d88e5a7","resolution":{"observed_at":"2026-08-06T19:38:20.530316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.672900Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":"ce92c869-8185-4af3-b07b-ea05dd889222","year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.533486Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:db6158862b1c1f95343a2678fbc27cde20a5edbf416ed982e3b1764c51a6e411","observation_id":"5e5556e3-48c2-4283-9fd3-23c6d9d927bd","resolution":{"observed_at":"2026-08-06T19:38:24.766718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01841","last_updated":"2023-12-07T03:14:22Z","snapshot_observed_at":"2026-07-30T10:55:21.867087Z","submitted_at":"2023-12-04T12:25:37Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01841","snapshot_observed_at":"2026-08-06T19:38:20.536182Z","title":"Vividtalk: One-shot audio-driven talk- ing head generation based on 3d hybrid prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.536182Z"},"links":{"cited_paper":"/paper/2312.01841","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:275b119128784bea4401582303a150874849a150a902a17dbf86133e1b71737b","observation_id":"d31bcbb6-b8f8-42cb-b8a4-c4d34335d420","resolution":{"observed_at":"2026-08-06T19:38:20.536182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.496902Z","title":"Masked lip-sync prediction by audio-visual contextual exploitation in transformers","venue":null,"work_id":"5448fa49-b52f-403d-ac7b-33ed948b7ff5","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.539264Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d0a107addce7df8cc7787ba39615f6a56570cf5be444c3c56651f8b7629f1c13","observation_id":"3c3df29d-292f-4f0d-a801-1f09a062b89d","resolution":{"observed_at":"2026-08-06T19:38:24.596939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.303830Z","title":"Synthesizing obama: learn- ing lip sync from audio","venue":null,"work_id":"323ef4fd-906c-460b-95f7-5395cf3d6912","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.542272Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:f38ae33b03bb1e29a6acc6ccf88170fbd904c105060e75ab50221284534af16b","observation_id":"3d2b0f69-728b-419e-8371-57b07ec3b469","resolution":{"observed_at":"2026-08-06T19:38:24.416179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.045628Z","title":"Human-centric founda- tion models: Perception, generation and agentic modeling","venue":null,"work_id":"00797161-cfb1-4be3-8cdc-c6e57452ddd2","year":2025},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.545160Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:23f39bbfbbf1f37ed634f211f31e9dd1f61048326b4e7ce0096d60f55f75c530","observation_id":"e12a29a5-f076-4969-97b5-4afc1ff8e784","resolution":{"observed_at":"2026-08-06T19:38:24.155157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.828000Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"65fa0a35-9e78-4619-a8ef-908a78054642","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.547678Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:6ef962fdf8a1d8ddbff667a52305fac5fbc4b956c4b3e36eeff580250ec9737f","observation_id":"595754d1-34d3-431e-bb73-9d6e071cbc06","resolution":{"observed_at":"2026-08-06T19:38:23.933754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-06T19:38:20.550356Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.550356Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:9e8967ed762c277d55572e41a7866dd6514a96ea9e57b6eb16562dd1be1683be","observation_id":"4a77f82c-db0b-40b5-b1ce-92998ccadec3","resolution":{"observed_at":"2026-08-06T19:38:20.550356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.641279Z","title":"Xintao Wang, Honglun Zhang, Chao Dong, and Ying Shan","venue":null,"work_id":"d89a0ee9-de18-4505-8c84-3e0ad840d74c","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.553474Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e00faf9c5d719fef62cddf033ed54a2258ae6695dd240324107cbe60541a49ac","observation_id":"19dcfa08-89cb-4ef2-88dc-3f3cc904297e","resolution":{"observed_at":"2026-08-06T19:38:23.698180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T19:38:20.556209Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.556209Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:f040334b61e62cd784c14bde2a78c328df7df9d37cc9a379cc5df2053be8cb38","observation_id":"4654cc85-ca5c-4d2b-8181-5c1c68606216","resolution":{"observed_at":"2026-08-06T19:38:20.556209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.368225Z","title":"Photorealistic audio-driven video portraits","venue":null,"work_id":"f6e947b3-1ed4-4503-b875-36df140bc230","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.559258Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d8b22188f637d9eb33262b9b235e2791a20e579efe8cc08449c515743ea78c71","observation_id":"507c5c7c-e994-4ad0-91d6-a0c91649c2de","resolution":{"observed_at":"2026-08-06T19:38:23.520340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.156926Z","title":"Monocular depth estimation using multi-scale continuous crfs as sequential deep networks","venue":null,"work_id":"54eb61f9-4e87-46c3-9e9b-6b1698cdd415","year":2018},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.562097Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c7f87ac80028b4b912f2a88b609aefe5ff1bc7bad43e2e34d507bd6c5d185c52","observation_id":"bc2f2c89-b3ef-4d21-8fc4-bdd1eb374986","resolution":{"observed_at":"2026-08-06T19:38:23.248574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T19:38:20.565284Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.565284Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:be44e9403e5221fb0e1ef9413fdd528222a6d820c1a851d6e38bc696d578219b","observation_id":"4f8d4c40-5d73-4182-855e-64329f5e6bcd","resolution":{"observed_at":"2026-08-06T19:38:20.565284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.942981Z","title":"Jointly attentive spatial-temporal pooling networks for video-based person re-identification","venue":null,"work_id":"ed631246-fcdb-4b65-b15a-0e8436f0ff22","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.568145Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:b3db923b3dc662e3326e98a064a484424fb9e6607126b47b54c9c9ff12b4fad8","observation_id":"d12e33c3-f04c-447c-9d90-d17c40df500b","resolution":{"observed_at":"2026-08-06T19:38:23.054479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T19:38:20.570734Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.570734Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:97915f38de18b145785082c0b72d9b49fc1b8abf790925ba08e8f919200c5a5b","observation_id":"dca78684-f3f4-463c-bd87-e6cd7a31d531","resolution":{"observed_at":"2026-08-06T19:38:20.570734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.680317Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"d18e0e6d-9d07-420a-b429-b25f13882e8e","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.573841Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:627e641ccb51b453a99449c76ccf7ca9fcfcec937e09bd2482682ad319e54537","observation_id":"dff6ae6e-ce79-4f35-a1a7-bbd36534cfdc","resolution":{"observed_at":"2026-08-06T19:38:22.788464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.419915Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"7249a67d-e1f0-4dbb-89eb-eb754b808322","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.576418Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c3c77a9c95360cb6057752877d301511b26861c2c7d18d56bb4350aecd12f907","observation_id":"75e3770d-6dcf-4c39-a418-8e21e67f5dbd","resolution":{"observed_at":"2026-08-06T19:38:22.536446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.170346Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"e6f13730-4dcc-453b-a51c-80c12d9f6ac6","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.579388Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:3a8b6f3fcf85e147b3e05522b48b86daf9d47d4516aafb6a975c33d5bdea5843","observation_id":"5b552dea-6b52-4284-a90d-f2bb8f8158d8","resolution":{"observed_at":"2026-08-06T19:38:22.300827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.949350Z","title":"Synergizing motion and appearance: Multi-scale com- pensatory codebooks for talking head video generation","venue":null,"work_id":"6fba8f26-6aa8-4846-88bc-317fc7d6b9a6","year":2025},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.582069Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c30ff4b9893c86485de4ac27337c40a072667963a043c4a07efe8d2c8e3066e9","observation_id":"be9364e6-806f-4294-96bd-d1152f147fb2","resolution":{"observed_at":"2026-08-06T19:38:22.071391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.712592Z","title":"Talking face generation by adversarially disentangled audio-visual representation","venue":null,"work_id":"ebda7fe2-eeba-4b99-938d-8da8396b6eb3","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.585041Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:ede7177c69528f8f45e6a32c9a5c0409673bb3896a9cd8b9f8d6d2a0ca93daa8","observation_id":"8869ee41-c585-4503-9ad9-5b28eb0f11cc","resolution":{"observed_at":"2026-08-06T19:38:21.866644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.512471Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":"4efc1016-189a-4af1-a4e5-0f9d0c732b87","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.588203Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:a9c56f561d33888c614b39347f8d03e4a7fc8a30200b900ea54f0799c12635f6","observation_id":"689b50cd-62c7-4faf-8a0e-6f3f39699a20","resolution":{"observed_at":"2026-08-06T19:38:21.588387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.241434Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"db47cba6-c056-44d0-a3d5-73d58a966524","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.590974Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:6fb07c14ecbc85b031d8f6cc4535d7a57592475b8b26c0f5bda4e6ddb7f6ebe3","observation_id":"16ce3c0d-c8d6-4417-98a8-ce28ee3543ca","resolution":{"observed_at":"2026-08-06T19:38:21.405568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:17:46.996950Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.05092."}