{"as_of":"2026-08-15T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b836786cfd5942f3420df95697c56408aceb8af446ac07b9ea4fa82bda93d0ab","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:15:10.988275Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:39:42.261377Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T01:58:51.378798Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"cited_work":{"arxiv_id":"2506.22065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22065","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mirrorme: Towards realtime and high fidelity audio-driven halfbody animation","venue":null,"work_id":"745a580f-1f64-48df-bad9-6d26eff5eea3","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2506.22065","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:81cce576d82c4204562314b033b5e654ddd87c954468863324c8efaee9018532","observation_id":"3aecc621-db5b-43ca-abdf-97e1784feef9","resolution":{"observed_at":"2026-05-17T01:58:51.381509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22065","snapshot_observed_at":"2026-08-03T18:39:42.261377Z","title":"Mirrorme: Towards realtime and high fidelity audio-driven halfbody animation.arXiv preprint arXiv:2506.22065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.261377Z"},"links":{"cited_paper":"/paper/2506.22065","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:366362fbe2cd5f04f71debade682d23d3d3ac7ed2dcdbb6ba647518a3156b032","observation_id":"e7d1445d-3efc-48f8-866b-590dff817efe","resolution":{"observed_at":"2026-08-03T18:39:42.261377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22065/citation-record","integrity":"/paper/2506.22065/integrity","json":"/paper/2506.22065/citation-record.json","paper":"/paper/2506.22065"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:15.974994Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations, 2020","venue":null,"work_id":"0f0880f3-e552-46fa-9717-f29aea43ebd4","year":2020},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:06.783016Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:2d8b5af98d9fc6b2adfceba7fe99777820e142e860b035634494d54872656b90","observation_id":"734f4ac1-2d33-47ab-8fe3-40ea6d5b65de","resolution":{"observed_at":"2026-08-06T22:15:16.063967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.817759Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:06.817759Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:469cdfa9c4b377feab1ab3541b3911e5b8a0042f284f74c59fa2a6554753dfc5","observation_id":"74d212de-7d3e-42de-bd6e-ce13f7bf98f7","resolution":{"observed_at":"2026-08-06T22:15:06.817759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-08-13T18:01:17.322810Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-06T22:15:06.874990Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthe- sis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:06.874990Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:70784720d0d440e2449636b01afa77f25d2c8b0b6339ea8aa90312be53a44981","observation_id":"2a41ba8e-4dd0-466a-969b-6a826e4cb14e","resolution":{"observed_at":"2026-08-06T22:15:06.874990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:15.784728Z","title":"Headgan: One-shot neural head synthesis and editing","venue":null,"work_id":"a8f308d3-2f1a-4012-9b42-2e03856282e2","year":2021},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:06.971448Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:b99e8a3e62c3060a0dce4d36e1e54587d8e46df7f9d9527a83280e5dc9d3e600","observation_id":"42158464-7561-4772-8727-c5bc0af53700","resolution":{"observed_at":"2026-08-06T22:15:15.876786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:15.623708Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":"95cd8b20-504f-4fff-80d5-69c7ddd0b375","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:06.987881Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:0b3add9c4542b84794492ec3c71e2ab3cd5418ee98a175f57652082cf49d644a","observation_id":"cce68330-9e08-4413-b3d1-f85e84fe076d","resolution":{"observed_at":"2026-08-06T22:15:15.695439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:15.489710Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis, 2024","venue":null,"work_id":"95f17aa0-0f4d-41c3-b773-a1130b8a51c5","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.110717Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:fdb132aa4def23877083332dd67ef340f6f5a5572b27eec39bc0ab43907b7c20","observation_id":"affa1dd5-84ed-4997-8bd7-1dfa608acfaf","resolution":{"observed_at":"2026-08-06T22:15:15.566897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:15.250841Z","title":"High-fidelity and freely controllable talking head video generation","venue":null,"work_id":"b01faac5-5a11-4145-bf68-8b4eaa058ef6","year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.185335Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:fb55d6499d3176dea0b3e193f9964090e1baeafaf06da10dec6324c95c4f51a3","observation_id":"6879313c-bf07-46fe-860a-d286b111d2d4","resolution":{"observed_at":"2026-08-06T22:15:15.354198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.250503Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.250503Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:54a3bd567bd6cfffc13605db8b1d719ec01c1d0aa746f13feb5f1c6c4a2f4c0f","observation_id":"cb997797-a4cf-4486-b97a-b997fb18f8ee","resolution":{"observed_at":"2026-08-06T22:15:07.250503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:15.071803Z","title":"Densepose: Dense human pose estimation in the wild","venue":null,"work_id":"ac2f5ca2-983f-46cc-ad12-819d73277646","year":null},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.340755Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:3e704fbd799acbb402f01bfaffbb95c23f9a3c4aca23af0b369fef859889362d","observation_id":"cc17ce50-34b9-42a5-9e90-afb49ffba882","resolution":{"observed_at":"2026-08-06T22:15:15.146492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-13T23:43:50.484861Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T22:15:07.444437Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.444437Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:f071ed034ca971fe8778df2a77a982e342c4b4d01bf7ddaf71e71d887f628bc9","observation_id":"6aaf8965-6a13-4c4f-8949-6642e08a1285","resolution":{"observed_at":"2026-08-06T22:15:07.444437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:14.881825Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning, 2024","venue":null,"work_id":"0558614a-8f5a-4338-9fad-001dfea86efb","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.547096Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:55f3de838244ae04895046dfbd75264a837eaf2a3f8625d3fa37d5365d671078","observation_id":"00df9e36-3b7a-4e9c-b392-daa4396af7f0","resolution":{"observed_at":"2026-08-06T22:15:14.988980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:14.695741Z","title":"Ltx-video: Realtime video latent diffusion, 2024","venue":null,"work_id":"cf3b3159-d654-4d44-ba15-056013e7543f","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.614477Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:25190a6158e7684e8c75722b41f788b9c49f58fa6d120ac476f72912ddab2f5f","observation_id":"b03dd559-c26f-4097-8167-74dedf99b2e1","resolution":{"observed_at":"2026-08-06T22:15:14.772701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.704164Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.704164Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:1e64e22aadcbf48cff3e5459e57f57ea101d582d8e74c0a09dbbc8eb18feab44","observation_id":"8c18808e-9e06-4a0f-93ec-6ce309bbc1f5","resolution":{"observed_at":"2026-08-06T22:15:07.704164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:14.518753Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation, 2023","venue":null,"work_id":"8d6c2372-e32b-4ae9-889a-023bcf77f1c6","year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.790558Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:6eb5394ccf41736f331c154f9d2869bcf2c5e7a6baae589e410464e1dfd4ddf9","observation_id":"3ffd4885-155c-4e81-abc5-f638a89c64f9","resolution":{"observed_at":"2026-08-06T22:15:14.591407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-12T22:51:36.940485Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-06T22:15:07.893234Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:07.893234Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:1b6d4e18947db7f2823594010b60cf24756cd52390328095ae2143f5b72ffc5c","observation_id":"6cca46f8-22f5-49c0-8595-7d013c542b4c","resolution":{"observed_at":"2026-08-06T22:15:07.893234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T22:15:08.000441Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.000441Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:5b9eb941aa1820a1a3abfec995b1aa645f8793564b475e1a8d351d36c457c6df","observation_id":"68788735-1475-4339-83b2-c8416bce71c5","resolution":{"observed_at":"2026-08-06T22:15:08.000441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T22:15:08.078452Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.078452Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:65a48a8e200efcdaae2619972b1fde81bc6ed1f24b41ec21a3536c20a86a8b5e","observation_id":"0636aea7-7fcd-4e80-ab1d-5f2b8b18daee","resolution":{"observed_at":"2026-08-06T22:15:08.078452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:14.366830Z","title":"Cyberhost: Taming audio- driven avatar diffusion model with region codebook atten- tion, 2024","venue":null,"work_id":"0614ef09-f530-4a17-b1fe-bba3dc3b875d","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.186136Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:f36ce937ccdaf733cb146cbc71d0ab84424a31d4c3b64776b84c2265579f076e","observation_id":"94aeeebb-3717-4c42-a712-b7608a74bc19","resolution":{"observed_at":"2026-08-06T22:15:14.422000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.256681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.256681Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:41e5715c4b1b5dc94ba58946cfb93a6fa945fcbca38b79252c27bd2cab044a49","observation_id":"8b9877f9-1d4e-4e5c-8881-6f54e769660f","resolution":{"observed_at":"2026-08-06T22:15:08.256681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.07239","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:11.373087Z","title":"Contextual gesture: Co- speech gesture video generation through context-aware ges- ture representation","venue":null,"work_id":"5e1bf469-79c6-40ac-b2c9-5b0eff7badf4","year":2025},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.352676Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:77cf1111b23d336651fa32611983fe7d1c189bb79d1e1b475e675da95f2ca620","observation_id":"03003a7f-4f5d-4b34-a0f3-b99ca0722cc2","resolution":{"observed_at":"2026-08-06T22:15:11.430723Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-08-13T05:01:00.463111Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-06T22:15:08.419865Z","title":"Dreamtalk: When emotional talking head generation meets diffusion probabilistic mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.419865Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:3a02f6220d0efad9ab9c7b4f336f405137180ecb88e0d3d00c986f054c620d0b","observation_id":"914f27cf-23b6-424b-8de6-87d67fa033e7","resolution":{"observed_at":"2026-08-06T22:15:08.419865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:14.174995Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":"a6875650-1708-434e-852d-594896bce3f4","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.496270Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:002700e29b3721e61cced4e0b16ff730a3bf7de489e6ed1cdf4db8e712fa3a8a","observation_id":"33cb5f90-de74-40bb-b61e-aa12aaf6b464","resolution":{"observed_at":"2026-08-06T22:15:14.240161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:13.990037Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation, 2024","venue":null,"work_id":"54cb6389-d49c-4f6e-a775-ecd8f7622760","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.571863Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:383466f6c333f4a8611675825d28e2bfd97fa49a408a9346782319dd21ed3a95","observation_id":"6414bd58-f282-4f0c-af20-0790b722467f","resolution":{"observed_at":"2026-08-06T22:15:14.075281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.645607Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.645607Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:df97f74fe68d0dd6109408a99dac65e3fec4e647b83fb8d8105d985f2fa33264","observation_id":"9449d49d-a198-4ea6-9fd0-c1a9a8aaf336","resolution":{"observed_at":"2026-08-06T22:15:08.645607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T22:15:08.717848Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.717848Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:6c390e05bdbc53d60a60cc7dfa01f851b37ee380f102243d911000570d1bffd0","observation_id":"38041d61-9b3a-4bfc-848d-e573dd9856d0","resolution":{"observed_at":"2026-08-06T22:15:08.717848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:13.798721Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"eba46413-b862-4c63-8ad9-5f5e44fdc553","year":2020},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.839958Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:278e534b76d44f9563bcca16358bcc430c44257e19b3f9f87e5b72db708562b7","observation_id":"84f008ff-f55e-4b9d-ad11-44d7ae67f778","resolution":{"observed_at":"2026-08-06T22:15:13.881768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:13.611197Z","title":"Pirenderer: Controllable portrait image generation via semantic neural rendering","venue":null,"work_id":"12dd588c-e644-4111-84ec-e6994bdfe2e6","year":2021},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.925812Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:75be8dddefe2734d839dcef97b04d624e04cc6f5131b12fff6e4eab62dc7f123","observation_id":"8c08dc18-2a0d-4db9-b2f4-476d9d44ea38","resolution":{"observed_at":"2026-08-06T22:15:13.713064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:09.011434Z","title":"High-resolution image syn- thesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.011434Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:900e74391d1a0e66b2e99c9ff8a70dc953c65de2525343d77feae4a569804cd3","observation_id":"5625fc53-4e99-440b-939b-e52b4f97cfe4","resolution":{"observed_at":"2026-08-06T22:15:09.011434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:13.413167Z","title":"wav2vec: Unsupervised pre-training for speech recognition, 2019","venue":null,"work_id":"43f13e1a-ba20-4209-94d8-9b30dcf01d92","year":2019},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.072609Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:c0a24850f35bd1240f20d13489076b2e304390594d5f92c01d1563c8fbc59037","observation_id":"498e7418-3eac-4960-8d38-f4479fc0f4c5","resolution":{"observed_at":"2026-08-06T22:15:13.496846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:13.231740Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":"88c133cd-2d8e-47e7-958f-62f60e299e99","year":1982},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.172872Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:014c707a3e6542a42714696cdc9289d9d7843b1c78504ec3331510efe4d872ca","observation_id":"f5d2bb0d-953e-41fe-9e96-649ae4172440","resolution":{"observed_at":"2026-08-06T22:15:13.329345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:13.106012Z","title":"First order motion model for image animation","venue":null,"work_id":"7fb64ca6-e5d6-49ed-af27-92b3b9275779","year":2019},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.265180Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:695d4fba55d979b1740d5afed9f7a375f4d02531e8ffd0629f106d1b944ff9d7","observation_id":"8e2d2a80-799f-4a57-99fb-650e9b17cf60","resolution":{"observed_at":"2026-08-06T22:15:13.166555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.955010Z","title":"Motion Representations for Ar- ticulated Animation","venue":null,"work_id":"51e8150e-e130-4103-9acb-5b41ea91e185","year":2021},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.329739Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:bb4e78a0613c76ca4465593db3723c247767672fece2dd16020f8c6355236130","observation_id":"49d5da74-6f0e-4b97-8f8c-0bc1656a0a9b","resolution":{"observed_at":"2026-08-06T22:15:13.031824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T22:15:09.426874Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.426874Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:c33857fea40202103608a644af8a7f761e4b066261727db2a0f8db45894f38ba","observation_id":"cf84800a-afdf-476d-bcb7-4a007e66234c","resolution":{"observed_at":"2026-08-06T22:15:09.426874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.796324Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":"1fbdaf3a-8a95-40df-a831-3c3dba5f6aa8","year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.518721Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:d544775dbe6748c8d8143bf0ec0bb0218591512a4da26c7b6c275bb17107514b","observation_id":"528cedd2-1037-4c67-b9a4-764d013fc53e","resolution":{"observed_at":"2026-08-06T22:15:12.875265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01841","last_updated":"2023-12-07T03:14:22Z","snapshot_observed_at":"2026-08-14T23:21:55.980013Z","submitted_at":"2023-12-04T12:25:37Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01841","snapshot_observed_at":"2026-08-06T22:15:09.615461Z","title":"Vividtalk: One-shot audio-driven talk- ing head generation based on 3d hybrid prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.615461Z"},"links":{"cited_paper":"/paper/2312.01841","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:706049f08e0439934a1df07dc57b0d0e37fb618b98576fc2b4f033b1489e427f","observation_id":"be10bb11-5a2c-458e-b027-b03348b3a6a7","resolution":{"observed_at":"2026-08-06T22:15:09.615461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.687609Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"d8ba07bb-fab9-4b9d-b4e7-037eb054f544","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.702705Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:0b0944e099d39621278620b2169c697f477ba670b44da9aac8bf60a644fde740","observation_id":"36dedce8-562c-4504-aa1a-9d56c1613bc0","resolution":{"observed_at":"2026-08-06T22:15:12.731414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.535894Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"e539286f-b229-4642-b60e-c5af6d2be293","year":2025},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.831850Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:e279f039e0f0569ccc8eb59bf2fd0b3a35e772b5cf5827ecdc89435d2c8c7390","observation_id":"de828712-2de9-4f5b-b3ed-3cf877ba24f6","resolution":{"observed_at":"2026-08-06T22:15:12.590772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.362471Z","title":"Video generation models as world simulators","venue":null,"work_id":"11865ea9-2bb6-49bd-a6c9-80358a1a21f8","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:09.956943Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:1354a6dc53c95ea4b02166cc27d6d0a79564287bf83d0c23a7ffec608f018cad","observation_id":"bceb05c7-6e09-49cb-942b-76401c21950e","resolution":{"observed_at":"2026-08-06T22:15:12.446574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T22:15:10.073906Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.073906Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:33a202f0dffb2efdf71be7af632c2967613b332a318609266f65e62b50928dd1","observation_id":"0954348a-96ba-465f-8671-0716054334d5","resolution":{"observed_at":"2026-08-06T22:15:10.073906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:10.154461Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.154461Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:dbacee00eab3a9babb20d8a65d57955960ccc93ea55d68b5583c5ab28a6cd568","observation_id":"007fc260-8475-4c0d-bb16-53c913a2e4a1","resolution":{"observed_at":"2026-08-06T22:15:10.154461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:10.264492Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.264492Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:44c72cea1f8707bfb522598571e6e97fced969f06d66e51e4b6ee5e072168802","observation_id":"8c9d5c35-c01b-446f-a24b-8cbb6fee46b9","resolution":{"observed_at":"2026-08-06T22:15:10.264492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-12T23:43:58.009316Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T22:15:10.341196Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.341196Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:3b1ff7fca83618ecbfb982b7c4b110fb0823c939bb0c745c768fb9c14aa4c8f6","observation_id":"e33b25f5-35a6-477b-9fe0-d98e240dc3eb","resolution":{"observed_at":"2026-08-06T22:15:10.341196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.207091Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":"1eaece0a-1995-4a36-b48b-6dcd5d4fd0c1","year":2025},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.413500Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:74db183457618954c4e639ceaa87216ab959f9e65c75cea2c7df2e11f071f824","observation_id":"64b1ee34-c744-4964-a379-e8052d7693e3","resolution":{"observed_at":"2026-08-06T22:15:12.266086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:12.045577Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model, 2023","venue":null,"work_id":"41d2249a-a8b0-4c43-a0d2-8b23b1b850e8","year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.491551Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:9be046d136e9c9af597282989512722835d68c5715823270b738c090581e1e29","observation_id":"af5707fc-ad13-4069-9ce8-02a9563587b9","resolution":{"observed_at":"2026-08-06T22:15:12.105902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:11.891968Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer, 2024","venue":null,"work_id":"cba1bded-fdd7-429e-b7b4-93964776c0a4","year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.553677Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:e987eaa8ec29cbe0242e6eaa125a0b1e02e15210ccb5d265608ae544150c4a52","observation_id":"a9259f75-51ca-49e6-a6f9-8c08150e3ff9","resolution":{"observed_at":"2026-08-06T22:15:11.976643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T22:15:10.627200Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.627200Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:87d59df9bdb04f64e399324b1ea95c55309f4888c95f4d78b3d6abce04f96558","observation_id":"d0b21054-d17c-493a-adb5-5546a8766b84","resolution":{"observed_at":"2026-08-06T22:15:10.627200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:11.722745Z","title":"Metaportrait: Identity-preserving talking head gener- ation with fast personalized adaptation","venue":null,"work_id":"e6dc8cb7-84e6-4604-8774-7b8d6a15bba5","year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.687896Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:98d16990833cce6cee3c80bedfa96ecf0933b795f9836b92225b4b04e01ab7b7","observation_id":"422cedc2-df94-4135-a8be-fff9975fc0f2","resolution":{"observed_at":"2026-08-06T22:15:11.807988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:11.564737Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"b83cb007-af96-429c-a524-61966e5ef550","year":2023},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.780635Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:7522ca87c46469a770b44e110feaf2771b8fe4b2cf20d0a42b5c7ff82a5f3c73","observation_id":"6da27382-e2ac-40e7-b179-747dc59baf85","resolution":{"observed_at":"2026-08-06T22:15:11.646420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-13T04:40:24.036354Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T22:15:10.839552Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.839552Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:ae8fd7ba492463c3bf09100324b333b0d110d3a7f1337035be9da71414022c2d","observation_id":"a37699d5-0da1-4905-8fc2-53590d6e5432","resolution":{"observed_at":"2026-08-06T22:15:10.839552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:10.896178Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.896178Z"},"links":{"citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:89fa3aecdcb7052654fc708671dd7805e07f72b357da90aa1cebf1982c7e0941","observation_id":"09f95457-9aa6-4471-a486-6428f67a40ea","resolution":{"observed_at":"2026-08-06T22:15:10.896178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-06T22:15:10.988275Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:10.988275Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:58fda0f6a5219a4fefb982c82ea99d9947667fa8eab058d1947d7d2fd5e31b40","observation_id":"8d7cad81-4fa1-4d7b-9da8-944d9fcc959c","resolution":{"observed_at":"2026-08-06T22:15:10.988275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2506.22065."}