{"as_of":"2026-08-09T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f7dc56771f6212dadd9bbfeecfef56c466365f66bb88a0843413cc828e13dd7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:11:25.264649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T17:23:15.330561Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":"2407.08136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Condi- tions","venue":null,"work_id":"d61530f3-e5d2-4f87-8cae-f67b8caf90da","year":2024},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:e7734eced8f988bb6d35326c2cc54ae401e03d233755082488a8ecf836581f83","observation_id":"459c315e-f939-4f26-89a3-5e93e0005029","resolution":{"observed_at":"2026-05-23T17:23:15.333451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":"2407.08136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Condi- tions","venue":null,"work_id":"d61530f3-e5d2-4f87-8cae-f67b8caf90da","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:d21b3efc5f7320eab6c5e69c40cf6052106f9a5a406061991638e03d192d66ff","observation_id":"1c22e319-d0ba-4505-95bf-b858d41972fa","resolution":{"observed_at":"2026-05-23T07:42:43.511917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-07T21:11:25.264649Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09533","last_updated":"2025-02-13T17:50:23Z","snapshot_observed_at":"2026-08-07T22:10:29.240376Z","submitted_at":"2025-02-13T17:50:23Z","title":"Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T21:11:25.264649Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2502.09533"},"observation_digest":"sha256:c1d336a5651879f661ac0bb199a666488867bc2166774ab99258845e8491b565","observation_id":"bd35958b-9046-4297-a994-217df4ce15b3","resolution":{"observed_at":"2026-08-07T21:11:25.264649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-07T13:49:48.623861Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions.arXiv preprint arXiv:2407.08136, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20861","last_updated":"2025-05-27T08:13:38Z","snapshot_observed_at":"2026-08-08T21:09:14.127086Z","submitted_at":"2025-05-27T08:13:38Z","title":"Exploring Timeline Control for Facial Motion Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:48.623861Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2505.20861"},"observation_digest":"sha256:c976b50a64ef3f3791d3c4847d928e6cfd358cafc133a5b845244d72c9f86cbd","observation_id":"17f683c4-da09-48fb-9451-d598bf33cdd2","resolution":{"observed_at":"2026-08-07T13:49:48.623861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-07T12:01:04.758873Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions.arXiv preprint arXiv:2407.08136, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.758873Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:bde5690c433bb013437495c0e3ca57f810383c0ebe0ff66df62fc330adb507db","observation_id":"088bdfa4-1de9-482d-9b3e-bce0028c595a","resolution":{"observed_at":"2026-08-07T12:01:04.758873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-07T00:15:44.536887Z","title":"Echomimic: Lifelike audio- driven portrait animations through editable landmark conditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14742","last_updated":"2025-06-17T17:22:12Z","snapshot_observed_at":"2026-08-07T20:51:47.320894Z","submitted_at":"2025-06-17T17:22:12Z","title":"SyncTalk++: High-Fidelity and Efficient Synchronized Talking Heads Synthesis Using Gaussian Splatting","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:44.536887Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2506.14742"},"observation_digest":"sha256:8bb9502678aa5a6ae1c49682029bbe45299fc9ae37d50a3e4f5acb0f25234898","observation_id":"fefc2380-e9f2-4f0e-84ae-c59b2f8e36c4","resolution":{"observed_at":"2026-08-07T00:15:44.536887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T22:28:18.025643Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21513","last_updated":"2025-07-10T06:36:05Z","snapshot_observed_at":"2026-08-07T20:50:14.621861Z","submitted_at":"2025-06-26T17:37:18Z","title":"GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific Adaptation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:28:18.025643Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2506.21513"},"observation_digest":"sha256:663c9b5ab30fdf4d9044db7f0bfd8a62a8c2ecae781568a870e6f4747eb429d7","observation_id":"72ca8740-86ea-4c9c-8211-1b18966d0519","resolution":{"observed_at":"2026-08-06T22:28:18.025643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T21:19:12.435775Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00472","last_updated":"2025-07-01T06:38:14Z","snapshot_observed_at":"2026-08-08T19:34:33.797020Z","submitted_at":"2025-07-01T06:38:14Z","title":"ARIG: Autoregressive Interactive Head Generation for Real-time Conversations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:12.435775Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.00472"},"observation_digest":"sha256:a7294c576e2bdf3c9665cc52e6652dfc01144d6d2db98eb7b6f3c013a1a3d319","observation_id":"793f0781-8f72-4cc1-8ea0-f91ba008a5f9","resolution":{"observed_at":"2026-08-06T21:19:12.435775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T20:58:22.315210Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-07T20:49:14.374372Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.315210Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:dee3c42b3216f2bec2de61896d44a1b010ed55a92f45918e739052679b2d5e95","observation_id":"d2afcd9e-6efc-48d3-97ef-7e7d6fc4ee67","resolution":{"observed_at":"2026-08-06T20:58:22.315210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T20:23:36.485347Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03256","last_updated":"2025-08-08T12:58:08Z","snapshot_observed_at":"2026-08-08T02:15:29.534181Z","submitted_at":"2025-07-04T02:25:10Z","title":"MoDA: Multi-modal Diffusion Architecture for Talking Head Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:36.485347Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.03256"},"observation_digest":"sha256:5dd6a34cb9e35e0cb16d6a2fb0dbd2f52cb2395536ecb6405a4e179ebba9ab75","observation_id":"f10498d9-b198-4772-8a64-fa468374c71e","resolution":{"observed_at":"2026-08-06T20:23:36.485347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T15:16:58.094767Z","title":"Echomimic: Lifelike audio-driven portrait animations through ed- itable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16341","last_updated":"2025-07-22T08:23:43Z","snapshot_observed_at":"2026-08-08T02:38:36.619570Z","submitted_at":"2025-07-22T08:23:43Z","title":"Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:16:58.094767Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.16341"},"observation_digest":"sha256:8266bcac7efa698059b8e4c86664ba1cfd453fb2341a22957fef1238350b25c1","observation_id":"9987ca77-76db-4641-ba9a-b2f7287e4d49","resolution":{"observed_at":"2026-08-06T15:16:58.094767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T13:37:10.781894Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20368","last_updated":"2025-07-27T17:53:00Z","snapshot_observed_at":"2026-08-07T20:50:14.751272Z","submitted_at":"2025-07-27T17:53:00Z","title":"MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:37:10.781894Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.20368"},"observation_digest":"sha256:bd4524db73734a8c98ddf7c3a0c0b8354b515764f418f19989a8da331d65f426","observation_id":"208cfa65-5d95-4f6b-96ab-6aa09243dc8c","resolution":{"observed_at":"2026-08-06T13:37:10.781894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T10:53:18.930569Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23343","last_updated":"2025-07-31T08:43:21Z","snapshot_observed_at":"2026-08-08T04:06:08.932242Z","submitted_at":"2025-07-31T08:43:21Z","title":"Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking Heads","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:18.930569Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.23343"},"observation_digest":"sha256:8d2a9867e0d71defc7f43ba9a49416374e4eda8e221b1942a648439db8a27ebe","observation_id":"8db2d14d-2303-49f8-b42c-0436688b80a9","resolution":{"observed_at":"2026-08-06T10:53:18.930569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T04:46:04.037670Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-09T04:46:02.489265Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:04.037670Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:49fbcf5b73f7afb45b66564c0e758d14a0f1a6fd13f8eba95aca20174369dab6","observation_id":"04945ce8-166c-4c18-b9a1-af83f84ca9a4","resolution":{"observed_at":"2026-08-06T04:46:04.037670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-05T19:07:41.978583Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-07T21:53:25.249431Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:41.978583Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:e82c3ae6d789d70ffe2b5b5a9956156f079507f169212bc2b7312bc22c0c596b","observation_id":"70b94a3a-6139-4b0a-a4e8-08319be5b1de","resolution":{"observed_at":"2026-08-05T19:07:41.978583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-05T10:36:52.470098Z","title":"Echomimic: Lifelike audio-drivenportraitanimationsthrougheditablelandmarkconditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.470098Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b5c08a3481252de1ec0c985f559fb00293c901904718639137e1c5aae0d8c728","observation_id":"e47c006d-73d1-47e7-8e90-e6c2ecf9bc31","resolution":{"observed_at":"2026-08-05T10:36:52.470098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":"2407.08136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Condi- tions","venue":null,"work_id":"d61530f3-e5d2-4f87-8cae-f67b8caf90da","year":2024},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:eccf9c00ed13ee6fdfa3f1d5e597f33f4f1f8a57c0c87480a365766999f43697","observation_id":"748011d4-950d-4699-a4fc-47c388e0fae5","resolution":{"observed_at":"2026-05-15T22:20:22.425605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":"2407.08136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Condi- tions","venue":null,"work_id":"d61530f3-e5d2-4f87-8cae-f67b8caf90da","year":2024},"citing_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T06:56:19.795651Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2604.23632"},"observation_digest":"sha256:58b0ac418d0c05b69b05fda5c2772b9b74c96c929b4d5537c5e98288a8baf8d7","observation_id":"189a8263-52db-49b3-8304-6ec9a721669a","resolution":{"observed_at":"2026-05-11T21:06:12.859273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":"2407.08136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Condi- tions","venue":null,"work_id":"d61530f3-e5d2-4f87-8cae-f67b8caf90da","year":2024},"citing_paper":{"arxiv_id":"2605.16918","last_updated":"2026-05-16T10:20:52Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T10:20:52Z","title":"HighSync: High-Quality Lip Synchronization via Latent Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T21:14:25.606097Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2605.16918"},"observation_digest":"sha256:a39c6c39d3e7976be592a0551aaf70a139d86bab96393b730311ea7cde3e403a","observation_id":"eb16d071-8429-4de8-9c1f-96a92f4a9664","resolution":{"observed_at":"2026-05-19T21:17:48.701892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-01T06:48:03.459550Z","title":"EchoMimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21776","last_updated":"2026-07-23T19:47:15Z","snapshot_observed_at":"2026-08-08T07:15:08.721576Z","submitted_at":"2026-07-23T19:47:15Z","title":"Physiological Signals as a Forensic Modality for Talking-Face Deepfake Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T06:48:03.459550Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2607.21776"},"observation_digest":"sha256:145431c6867743ccc6a80e3774610f14cd728a470807ef72b2716169d9e0efbe","observation_id":"2f11b0c3-665f-492c-a3e9-e6b505c18d59","resolution":{"observed_at":"2026-08-01T06:48:03.459550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.08136/citation-record","integrity":"/paper/2407.08136/integrity","json":"/paper/2407.08136/citation-record.json","paper":"/paper/2407.08136"},"outbound":[],"paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2407.08136."}