{"as_of":"2026-08-10T11:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2660aea3011fdfe9b36f762e3b31606f2d8cf4ad950af5152db16b934674f304","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:40.126961Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T03:30:18.645845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:31:04.271468Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"cited_work":{"arxiv_id":"2506.16852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Controllable and expressive one-shot video head swapping.CoRR, abs/2506.16852","venue":null,"work_id":"7045a48a-f42f-4df4-87ca-d607bc11d648","year":2025},"citing_paper":{"arxiv_id":"2604.19129","last_updated":"2026-04-21T06:22:47Z","snapshot_observed_at":"2026-08-07T16:28:09.434053Z","submitted_at":"2026-04-21T06:22:47Z","title":"PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T03:30:18.645845Z"},"links":{"cited_paper":"/paper/2506.16852","citing_paper":"/paper/2604.19129"},"observation_digest":"sha256:ec85b78af61559a318ff8271af95e7bdc051fd000297732fb9435ef88cfe4441","observation_id":"81b72779-09e7-4771-b09f-ffb12bf02ee3","resolution":{"observed_at":"2026-05-11T12:31:04.277354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16852/citation-record","integrity":"/paper/2506.16852/integrity","json":"/paper/2506.16852/citation-record.json","paper":"/paper/2506.16852"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.402237Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.402237Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:ffa57ccf70a0d8211231bed65aaae46c4317e581ac6524353a420f1249139d1b","observation_id":"2cfbf0e5-09ed-43b4-9d89-1c7cf941bd32","resolution":{"observed_at":"2026-08-06T23:42:32.402237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.479695Z","title":"Topiq: A top-down approach from semantics to distortions for image quality assessment.IEEE Transactions on Image Processing, 33:2404–2418, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.479695Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:71aea247c34a4025d8e04d2e380fc058e292540c01c477082b29ddafda6f51ee","observation_id":"259a538d-568f-4484-9e98-dd7093dda501","resolution":{"observed_at":"2026-08-06T23:42:32.479695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T23:42:32.548945Z","title":"Videocrafter1: Open diffusion models for high-quality video generation.CoRR, abs/2310.19512, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.548945Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:5bfb35d9bfbfad3d3d55f338870bc696f5fd4f8e4a3cdea3b2b51413f8c36087","observation_id":"c61af588-a55d-4f4d-a299-44a33744a8d6","resolution":{"observed_at":"2026-08-06T23:42:32.548945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.651647Z","title":"Maddox, Zhiyao Duan, and Chenliang Xu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.651647Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:540df3f0639fc7530a193e7d079c29a7cd1c2eb11e8b8424c32f3b0a3d2a90c6","observation_id":"c307d904-3bb3-4265-bcfc-ee3d4263fa00","resolution":{"observed_at":"2026-08-06T23:42:32.651647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.750627Z","title":"Simswap: An efficient framework for high fidelity face swapping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.750627Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:fa10e0dffdc2bbb220df9cc7be47b1fabc15d2d2a31440af0401de0911df8ccd","observation_id":"f2e69ef8-5d75-40c2-a28b-d0108e5b0833","resolution":{"observed_at":"2026-08-06T23:42:32.750627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.878180Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.878180Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:3235bffe478861da88800d719375d78ab2345614c28b697f65d9d4939db102ce","observation_id":"5236d489-f8f9-4812-9aca-3209db6f2d36","resolution":{"observed_at":"2026-08-06T23:42:32.878180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.944909Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.944909Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:c8148b375c234573c5057ee5e857c298cd405731f89905315ea2288a36d22e47","observation_id":"4672616c-424d-492a-b4ef-487c0beab42e","resolution":{"observed_at":"2026-08-06T23:42:32.944909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.044754Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.044754Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f50d57588525b49523a69ad747798d750f4837d356d5b57faacedb0cf69409bb","observation_id":"f67f8e1c-ecde-45fc-bf0a-39bb3c2ff2c2","resolution":{"observed_at":"2026-08-06T23:42:33.044754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.130159Z","title":"Dreambooth++: Boosting subject-driven gen- eration via region-level references packing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.130159Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:df14ed9623f8c2fbb5410079b9de4977c8ec57b2bafe4bf2870257134bfa0376","observation_id":"219a2446-5ac2-43d0-af74-ca155c66189b","resolution":{"observed_at":"2026-08-06T23:42:33.130159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.214285Z","title":"Mitra, Peter Wonka, and Jingwan Lu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.214285Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6863a2632b09889a554049b32db8c107e419ff7f5ae06774dd8680ec0cc5db95","observation_id":"89aaa69c-b725-4ea1-88bc-dc123467a702","resolution":{"observed_at":"2026-08-06T23:42:33.214285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.329644Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style- based generator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.329644Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:2a63a6ab48977f2de1a76e7af5cef5b9bdf2f0f6816cc0ef787da66326f5b551","observation_id":"8d64a037-05c1-4950-96a8-e31367f04a20","resolution":{"observed_at":"2026-08-06T23:42:33.329644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T23:42:33.430511Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control.CoRR, abs/2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.430511Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f58315fe76ef589bbe27ed1b09cf3bb30a6111e00aac6393e1c910c92652d60a","observation_id":"143f50fb-185e-4309-8a31-51dc44e42202","resolution":{"observed_at":"2026-08-06T23:42:33.430511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.534991Z","title":"Ad-nerf: Audio driven neural ra- diance fields for talking head synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.534991Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f960d94f7d58ebfd5ff60e0295b55a9a00d6de5bbbe5679f80ff094d9e597ed6","observation_id":"40c5cf49-cf58-43fd-8550-a72bb4a01ef8","resolution":{"observed_at":"2026-08-06T23:42:33.534991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:52.564756Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":"03a1ea7b-b97a-4bd0-9fa2-e97b1eaa45a7","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.615758Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:b3f2bea66f2ae04276baa94d7a1fa59a104661c39ccddca1a543b80625b5505d","observation_id":"b11ee47f-0be5-4993-930a-f0fe5b8b4564","resolution":{"observed_at":"2026-08-06T23:42:52.664738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:52.300089Z","title":"Latent video diffusion models for high-fidelity long video generation, 2023","venue":null,"work_id":"5b826a1f-ff06-4108-af09-90ca290c7256","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.735042Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:d30368b7c3c149eaa69e1ab7a319ba259f3193255fe851749dc14be603fb41c7","observation_id":"999214f6-b915-47d7-94e1-9090b3169ea1","resolution":{"observed_at":"2026-08-06T23:42:52.384749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:52.024745Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"c81da393-cdca-4cd9-9650-80e5aa8551f7","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.850081Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:2800a1730ee36d0d63df84b4e3771261a10917e9cd1dd438f01e71bb9ebf34f0","observation_id":"fa30ff21-cf89-4a8b-9e8e-fbe467b6c3c4","resolution":{"observed_at":"2026-08-06T23:42:52.155017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.894402Z","title":"EAMM: one-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.894402Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:88328c6a21d819edb7c4bc061ee52d7117794014834408d7bd8da756281df874","observation_id":"2581ad79-21f5-4137-9746-7c360df47491","resolution":{"observed_at":"2026-08-06T23:42:33.894402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-06T23:42:33.980220Z","title":"Sapiens: Foundation for human vision mod- els.arXiv preprint arXiv:2408.12569, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.980220Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f2b400d770eb93867b0bf8da9ca8e41569d8f843f9e821e56428b51e697bc622","observation_id":"e7518576-ac00-44e3-aad1-8dfeedd98dfa","resolution":{"observed_at":"2026-08-06T23:42:33.980220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:34.058838Z","title":"FLOAT: generative motion latent flow matching for audio-driven talk- ing portrait.CoRR, abs/2412.01064, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.058838Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:29c6ff5c6bc59e7b8b96ec1ea9b696f8d0bc22790d6700996346646c8320e9e3","observation_id":"e8a74e12-11db-4b31-9b05-d6682879be38","resolution":{"observed_at":"2026-08-06T23:42:34.058838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.582857Z","title":"Smooth- swap: A simple enhancement for face-swapping with smoothness","venue":null,"work_id":"326ba8d2-88c4-4a69-bb3c-cdcfe2e36be9","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.149740Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:aebaf0d76eb107e7708cf80a71a575d1fad6134992fbb3d396707bf7c1e112b4","observation_id":"e073ba26-7869-43d0-9370-40972b71c20f","resolution":{"observed_at":"2026-08-06T23:42:51.724846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01442","last_updated":"2017-12-06T16:18:31Z","snapshot_observed_at":"2026-07-06T06:17:13.488115Z","submitted_at":"2017-12-06T16:18:31Z","title":"ObamaNet: Photo-realistic lip-sync from text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01442","snapshot_observed_at":"2026-08-06T23:42:34.233433Z","title":"Obamanet: Photo-realistic lip-sync from text.CoRR, abs/1801.01442, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.233433Z"},"links":{"cited_paper":"/paper/1801.01442","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:5d7cfd4ac911833a7af6872d00e1a9c688fe0b1e2986ade0646ea4f8c896628c","observation_id":"6da13f26-31f8-48e5-a7ba-5194f8c68188","resolution":{"observed_at":"2026-08-06T23:42:34.233433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.187119Z","title":"Faceinpainter: High fidelity face adaptation to hetero- geneous domains","venue":null,"work_id":"ba9e15eb-4ccc-4d09-862f-1b76e2d72a66","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.342113Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6055d0b0034ca578f6a694ab3f2184069f60271855442af35433598b53d455aa","observation_id":"ddd24a4c-626b-49bf-8bda-3a9f9b2298dd","resolution":{"observed_at":"2026-08-06T23:42:51.316705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13457","last_updated":"2020-09-15T07:43:58Z","snapshot_observed_at":"2026-08-08T08:09:14.122603Z","submitted_at":"2019-12-31T17:57:46Z","title":"FaceShifter: Towards High Fidelity And Occlusion Aware Face Swapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13457","snapshot_observed_at":"2026-08-06T23:42:34.418802Z","title":"Faceshifter: Towards high fidelity and occlusion aware face swapping.CoRR, abs/1912.13457, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.418802Z"},"links":{"cited_paper":"/paper/1912.13457","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f44ce45283684edfa7f7b63273a9078ce6e334518861d8ad0cdb4580fa4f7e34","observation_id":"aa10127f-56cd-432a-b11e-598794618d74","resolution":{"observed_at":"2026-08-06T23:42:34.418802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.784749Z","title":"MAT: mask-aware transformer for large hole image in- painting","venue":null,"work_id":"da9a2e06-4453-4d4e-a13b-33655b0541a1","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.498581Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:043647827275e135a15765b7de21d18bc7063db3bdd1c546302db1cdbfb0bb9a","observation_id":"07303992-2d46-444d-beb8-ba6f3dc9e0cb","resolution":{"observed_at":"2026-08-06T23:42:51.025786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.433319Z","title":"MAT: mask-aware transformer for large hole image in- painting","venue":null,"work_id":"ffd57bde-e907-4922-bb6f-73f686b87a6b","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.564964Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:045363fa728d55be3ef3fbf89910ab9e03ab117e9dfd76ec64b419b38eb82c83","observation_id":"88f9c642-4cb2-45e4-a7b4-fc33961c41d9","resolution":{"observed_at":"2026-08-06T23:42:50.614752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.036039Z","title":"Expressive talking head generation with granular audio-visual control","venue":null,"work_id":"a852cd75-4a8b-4816-b3e8-67b67dbf2305","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.651078Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:db17872cb53cacc4514e7f02dd67f29cdf29355cb9a43df4114bf0cbb01d93a5","observation_id":"89ec69e1-e0d3-411d-88df-22b0a6f78f9b","resolution":{"observed_at":"2026-08-06T23:42:50.254861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.759539Z","title":"Deepfacelab: Integrated, flexible and extensible face-swapping framework.Pattern Recognit., 141:109628, 2023","venue":null,"work_id":"bce03668-319c-45ac-a871-07b9081857b7","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.724128Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:846f0c9c3f84ad94148156f38965bec4548f72863b8cba615c440b3f2f0c15ee","observation_id":"8d89407e-2e24-460b-9d67-a272c3c5ba39","resolution":{"observed_at":"2026-08-06T23:42:49.876203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:34.817105Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.817105Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:20a6be7d355a28bc660080865a7d7d16d0d56b43cfe46040cb5a128e4c81543f","observation_id":"804691c5-abca-40b7-af05-9f4cfca8408b","resolution":{"observed_at":"2026-08-06T23:42:34.817105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:34.898075Z","title":"Mediapipe: A framework for building perception pipelines,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.898075Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:1c7148ae5ce402ff7f63ce862dd3a02e6e448c8f1dbd23b2f09b8fa4280e32b6","observation_id":"5acca453-08d7-46dc-bdec-fcffad8d11cc","resolution":{"observed_at":"2026-08-06T23:42:34.898075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.393533Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":"0e3c9167-8220-4175-a526-3f7125a118c3","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.984227Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:31046a6102379e724eaa4afe367ffe3ec2a56baaef4fbb513e78c94f8fed5067","observation_id":"ed4c5d86-9379-4a2b-a334-779c7f7a5a43","resolution":{"observed_at":"2026-08-06T23:42:49.453214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-08-06T23:42:35.066825Z","title":"Follow-your-click: Open-domain regional image animation via short prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.066825Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:4e5d98b3a14a2266b5f686c9c0f6f6b7dd2cc5f3d5e239d866f431259870e30b","observation_id":"3fe2b8a9-b8a0-48ec-9129-6eb84948414c","resolution":{"observed_at":"2026-08-06T23:42:35.066825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.159073Z","title":"Follow-your-emoji: Fine- controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.159073Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:00e6233546301f1d42b6910d8bbed92c20ad1fd4fa9977512bba6067cb3dab62","observation_id":"87a4adf4-620a-4a72-a05f-285d247dcf15","resolution":{"observed_at":"2026-08-06T23:42:35.159073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.108031Z","title":"V oxceleb: A large-scale speaker identification dataset","venue":null,"work_id":"0d46c60b-92dd-4828-ae62-890527ebc804","year":2017},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.245149Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:bcc19bf3c911f4cdc941721a25fd378bf97ccf48f3072f03f5fc48932c3c436b","observation_id":"2826a8f9-b0cb-4fe5-83ee-2ac2baa8afa5","resolution":{"observed_at":"2026-08-06T23:42:49.187349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.861267Z","title":"Fsganv2: Im- proved subject agnostic face swapping and reenactment","venue":null,"work_id":"8ca211d8-f22f-4a9e-afae-0e2506b19684","year":null},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.339850Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:87b8f341d9f3f928a09029a3b276cee645b3ead3303a8664702603f96a6def56","observation_id":"bd89c539-f93c-4afd-b1b3-91da8c57bc26","resolution":{"observed_at":"2026-08-06T23:42:48.944745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.596017Z","title":"DPE: disen- tanglement of pose and expression for general video portrait editing","venue":null,"work_id":"228042bb-803f-4d34-b3cb-5f9d2e3fbb47","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.447089Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:886e0fcbc610cf3ebf56a2f89a43d80692184d13ecec758e5158d756c134185b","observation_id":"315584a3-51a9-414f-94bc-010bb3f09a8e","resolution":{"observed_at":"2026-08-06T23:42:48.704745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.510645Z","title":"Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.510645Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:53cd6630339ddf0cfb4424370ed92b4ac4bfdbb2306ac5cc133a0e549c4f739e","observation_id":"dc393645-2ac5-40c6-ae47-b4db6152b927","resolution":{"observed_at":"2026-08-06T23:42:35.510645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.314752Z","title":"Nambood- iri, and C.V","venue":null,"work_id":"1f0e2728-331c-464c-8e02-7dafc281c5a8","year":2020},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.574841Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:052bf2fb2e44b9e86800eb3d2e69a93e3d7c18ae5225f292df5570e5d6ff343b","observation_id":"b8943662-c49e-4515-bfa8-9df6248e61e7","resolution":{"observed_at":"2026-08-06T23:42:48.422105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.644544Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.644544Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6e08697e7e711e7d47692aa0d81b90bbf27f53be2ffa51b66d13d03d7596b29c","observation_id":"03a2a14f-c08c-42a9-b8d5-55da8c5bacdc","resolution":{"observed_at":"2026-08-06T23:42:35.644544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.009718Z","title":null,"venue":null,"work_id":"7a3cda92-8800-4ccd-87a4-f87961b5e50f","year":2018},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.713788Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:1b486cdd4d903d4fb9c40feadd91236488743fa4f22df2927c4f5e0f11a01692","observation_id":"ff7755d2-20c0-4bca-aa42-573ff783d1a2","resolution":{"observed_at":"2026-08-06T23:42:48.114756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.792867Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.792867Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:eefd339b7a3058ada397be491c96498900df375f71ab0c7a4f07cf374a25aa69","observation_id":"e6195219-27e4-49a2-984c-390cd5f1b3bb","resolution":{"observed_at":"2026-08-06T23:42:35.792867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11263","last_updated":"2021-02-22T18:50:47Z","snapshot_observed_at":"2026-08-10T02:00:49.697589Z","submitted_at":"2021-02-22T18:50:47Z","title":"Style and Pose Control for Image Synthesis of Humans from a Single Monocular View","version":1},"cited_work":{"arxiv_id":"2102.11263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.11263","snapshot_observed_at":"2026-08-06T23:42:40.688399Z","title":"Style and Pose Control for Image Synthesis of Humans from a Single Monocular View","venue":"cs.CV","work_id":"efcb5712-bfdd-464f-acca-06bc0bd016c9","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.879400Z"},"links":{"cited_paper":"/paper/2102.11263","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:0b085e29e8710f32b9e23992aa22ea29c234e2b28c0803cdfdc63b95f8852dcf","observation_id":"e2a7e11b-ff34-45f8-90c7-9790293be03e","resolution":{"observed_at":"2026-08-06T23:42:40.805594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.677227Z","title":"Few-shot head swapping in the wild","venue":null,"work_id":"1cbd34d6-91f8-4ed4-a75e-3e2e58950d70","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.990382Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:20e01d0103f654d6f81ab1f806ae793432e529449742fc65ad3599b378252903","observation_id":"0aa9b03d-e743-4b47-9e72-a2cdafbc6471","resolution":{"observed_at":"2026-08-06T23:42:47.775488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.485120Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"b798d437-4d26-4930-bc5c-2a7ea8b5b2cb","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.144755Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a2bcca4de3de7ff8e124ea0eb06f0c239022239cf2d4369b18aed0f2676d4130","observation_id":"f814a81e-d8b0-4626-9e1d-6e255006cb75","resolution":{"observed_at":"2026-08-06T23:42:47.556014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.040740Z","title":"Everybody’s talkin’: Let me talk as you want.IEEE Trans","venue":null,"work_id":"da7da63a-0c99-4231-bbce-9cea3866fc5a","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.310637Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:d8460fc4be1545fbaef90a4b44778b11ba7af813379ce351e557ca0dfc966314","observation_id":"3c00f839-d2fd-43b0-bf3f-71c1ef337fcf","resolution":{"observed_at":"2026-08-06T23:42:47.129615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.838792Z","title":"Talking face generation by conditional recurrent adversarial network","venue":null,"work_id":"578eac98-007e-44c7-b148-89b4d2c75e5e","year":2019},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.402233Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:ba9d9930d14ccbadd9a64b5756351f947c8ef23d134d4640c4c67148474f1702","observation_id":"d8593fbe-0aa2-4f64-943d-98467d59531e","resolution":{"observed_at":"2026-08-06T23:42:46.933706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.612771Z","title":"Speech2talking-face: Inferring and driving a face with syn- chronized audio-visual representation","venue":null,"work_id":"15b2319f-5d67-4827-be57-636d88b0bcfd","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.534751Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:7827d270021f7f7f32bca310d50a6911ef9e3dd5109b2ad40a1b00e73f75f972","observation_id":"22f74eb7-17f4-4752-9e5e-996406c71559","resolution":{"observed_at":"2026-08-06T23:42:46.684836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.384750Z","title":"Resolution-robust large mask inpainting with fourier convolutions","venue":null,"work_id":"041b972c-9d17-4d94-9dd9-200ab998c7a9","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.646100Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:391c278c0db507015f92e0b31d1ae364fee3c605ac2e046863273dcc85a86dc7","observation_id":"086e9585-ac6f-4bb9-aa34-b72ebd88ef83","resolution":{"observed_at":"2026-08-06T23:42:46.496396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.119028Z","title":"Flowvqtalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"68471132-4e1e-4362-a093-7483fc7e81ae","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.824757Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:07f40d8d336ea06d142248cfc122c2e506d372e7763da57694a5a86994f31a14","observation_id":"e8c55433-7b48-420e-81b8-70cb42423357","resolution":{"observed_at":"2026-08-06T23:42:46.255704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.924750Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"de784a0f-f21d-4d49-80e3-3b05866fa33d","year":2020},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.944970Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:cd40214da26395dbcdefedf611e6784620b3c7034fcd707f6c1e7a1a95e2995d","observation_id":"b8c2a4c1-d6ed-4f49-9506-698eb3e20c7a","resolution":{"observed_at":"2026-08-06T23:42:46.001561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.509057Z","title":"EMO: emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"811947d5-9635-48c8-9a87-0437cbf063eb","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.024896Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:baeaa8feebeafaa27117dac2ed9a191e695cfb7ea0db8489d0d99d367e85ffb5","observation_id":"5386b1de-212b-4bd4-b801-898bf6c6f6ac","resolution":{"observed_at":"2026-08-06T23:42:45.754867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.324418Z","title":"Faceverse: a fine-grained and detail- controllable 3d face morphable model from a hybrid dataset","venue":null,"work_id":"502653f7-ff7f-4209-b6e7-ef1da0c55b6a","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.136811Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:9698648d65551f15226b210c254aa39b4bc1a85d2d5503fd438976870080652b","observation_id":"3c6621db-5c41-4444-9b40-d891e8cc16e5","resolution":{"observed_at":"2026-08-06T23:42:45.436883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.101869Z","title":"Stylea- vatar: Real-time photo-realistic portrait avatar from a sin- gle video","venue":null,"work_id":"2662a56c-2af7-4022-b959-691a8f382479","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.255788Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:10190c5bc1a181d1af57a91e2ca6156021dce08c928d3c61fa208cdadd5715a8","observation_id":"e14facbc-0d48-4443-89b0-a60dde4f52d0","resolution":{"observed_at":"2026-08-06T23:42:45.208396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:44.781722Z","title":"Hs-diffusion: Semantic-mixing diffusion for head swapping, 2023","venue":null,"work_id":"50a5da74-f78a-4747-884e-503bf5f547c3","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.367418Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:b26085a7cf86799677ee1edaca922f0921adb922cff4ecfd11ac92f92f1bdbb1","observation_id":"d4b174dd-5bcd-44d8-b0b7-934b5bd63d91","resolution":{"observed_at":"2026-08-06T23:42:44.955034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:37.465605Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.465605Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f5f9053474bf1dc94b4b8dce52509a95ada7f666c5377c4de9bde6f3868f02d5","observation_id":"582fcfd8-bcca-4ec9-a57d-c6fc3edc02ad","resolution":{"observed_at":"2026-08-06T23:42:37.465605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:44.434752Z","title":"Hififace: 3d shape and semantic prior guided high fidelity face swapping","venue":null,"work_id":"18cf9770-1bcf-4b36-babc-d56fae8a9cdf","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.597995Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:39b3cd0fa6b55e1d717eb0f11c3d82c7e9ed963efd4ab3c9a79a6154a3eeba17","observation_id":"df3ccc09-1de0-4ddc-94d9-1e258294807a","resolution":{"observed_at":"2026-08-06T23:42:44.564755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:37.708687Z","title":"LIA: latent image animator.IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.708687Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:238fc5a86d218f7fe888ae1a95684dee6084f45d321bdb96aef3f2d365bce5c0","observation_id":"a892496d-c9d2-443e-bc9b-aaf3656ec1d8","resolution":{"observed_at":"2026-08-06T23:42:37.708687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T23:42:37.820190Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.820190Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:18a1627ebbe151c38732652b92ae813950a0e1f47e1f8e4e6a31ddbce1126d09","observation_id":"e7768a50-d62b-4394-bd18-c1521d85f809","resolution":{"observed_at":"2026-08-06T23:42:37.820190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:44.045059Z","title":"Imitating arbitrary talking style for re- alistic audio-driven talking face synthesis","venue":null,"work_id":"d4313586-a9c2-4f47-8d65-4415892efc8f","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.924348Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:da97d5b44339e1464ff878687f7a3ad08105ddab0e7a3b5eb24f51d709ba6b41","observation_id":"4ec8e729-cc94-4959-959f-890b6709e9e9","resolution":{"observed_at":"2026-08-06T23:42:44.174833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:38.083908Z","title":"VFHQ: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.083908Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:451a890a74af5e75262c164f6037ede2600207ce206a167122fdc795faf299c3","observation_id":"afc9ff08-e424-494d-9dc1-b8d15cee140f","resolution":{"observed_at":"2026-08-06T23:42:38.083908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:38.325912Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.325912Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a3449f2b625cc9937c91bd217d90db3fda847ac9ac1ded8ebfb60db285952e14","observation_id":"391ac3c5-08e4-47bb-a6ee-163bc9d2d9af","resolution":{"observed_at":"2026-08-06T23:42:38.325912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:43.535083Z","title":"Make- your-video: Customized video generation using textual and structural guidance.IEEE Trans","venue":null,"work_id":"1d2185d9-ed4b-41f2-b89d-1756bc2b0991","year":2025},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.484837Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:4ce1e0f77ea6cac5a052e084c4cac5fdb7ddffef05b5a9bbd0583d324c723095","observation_id":"861de74b-05ee-4937-a321-2327e5c5242e","resolution":{"observed_at":"2026-08-06T23:42:43.717793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:43.270034Z","title":"V ASA-1: lifelike audio-driven talking faces generated in real time","venue":null,"work_id":"9f77b171-4501-4633-8f83-0a6cee274379","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.599148Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a6b6ee8877fca989e6ba69ce2d4bac12e4107f0c6fd9a63de13ba921f2b036db","observation_id":"cb249c73-bd87-4283-aab0-a3c1be1c4302","resolution":{"observed_at":"2026-08-06T23:42:43.394846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:43.091801Z","title":"High-resolution face swapping via latent semantics disentanglement","venue":null,"work_id":"788d7e2a-98cb-4c94-add7-9c9bcc61a566","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.724749Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f042309bbfeca0869fec814027e84936c832241ff2d2cbfd505460dc51818d7e","observation_id":"20316304-2696-464b-a312-7a236b1a73d3","resolution":{"observed_at":"2026-08-06T23:42:43.167772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:38.883309Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.883309Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:5852e902d51cebfa4261f3b63d920bc36889efd3166cc86d8f6b4afc1a2d02f6","observation_id":"4162a006-e639-4859-8ec3-ae821548b1a3","resolution":{"observed_at":"2026-08-06T23:42:38.883309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T23:42:39.049844Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models.CoRR, abs/2308.06721, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.049844Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:b50d75b4721782d8fd7d0a6f666e647ada342c382ed405fc8ac2bdbb27b9eff6","observation_id":"fdcb9b24-858c-4abe-ade1-f7f043b8020f","resolution":{"observed_at":"2026-08-06T23:42:39.049844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:42.766530Z","title":"Metaportrait: Identity-preserving talking head gener- ation with fast personalized adaptation","venue":null,"work_id":"00e66ad7-d074-4e24-83d6-dda170aa9bb5","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.165036Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:4d76f2b9cece7aac8522dced2d828638c9ce2f83903f47a23b76ec3054d6b41e","observation_id":"594b1f39-6b30-43ea-a961-8a36cae0dc05","resolution":{"observed_at":"2026-08-06T23:42:42.900327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.282275Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.282275Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a67ff90fb9de01802d4daece2b96c6e1c1201992524174c487b5273f12f75960","observation_id":"69cd3129-4ef4-4942-8d90-58236e9d0cc8","resolution":{"observed_at":"2026-08-06T23:42:39.282275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:42.476106Z","title":"Personatalk: Bring attention to your persona in vi- sual dubbing","venue":null,"work_id":"18054778-ebfe-4a41-9491-22dbd18b089a","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.364749Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:d058e0497394615c5dc73234b820c7ceda7af8407b07fc458ef96e70ef6ff820","observation_id":"d5b385df-6682-4194-b051-e9a3f0114460","resolution":{"observed_at":"2026-08-06T23:42:42.593289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.524838Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.524838Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:907d121a53c4a73dcbfad91da4a73a9980765793196fdb0f2920d916b675ef2e","observation_id":"a48a6aa1-34e0-4db4-90db-83fc5818cc48","resolution":{"observed_at":"2026-08-06T23:42:39.524838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:42.226225Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":"f157389d-6f44-4937-afb3-2bebaf0780a7","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.749317Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:24d8427c4946c0206e2a86cf60a0c40913cff993e99d482eb261a0ee8d2ecfb8","observation_id":"46c9cf21-dfa9-4ec0-a6ce-de706a7d7882","resolution":{"observed_at":"2026-08-06T23:42:42.366312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:41.974510Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"262f7901-ba2f-4813-864f-b0cbdcd93616","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.856920Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:0e2a17484cddc4bcc209ce9c4c1f554ca5dcf44ec133a0f70610b66f17074cf3","observation_id":"548df4c3-6e3b-4f4e-9f23-aa45eb39320e","resolution":{"observed_at":"2026-08-06T23:42:42.064766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:41.654751Z","title":"Diffswap: High-fidelity and controllable face swapping via 3d-aware masked diffusion","venue":null,"work_id":"27934ce8-74af-46d8-9e02-4d9cc8f825a7","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.997239Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:c79d26f36580aa1eb16e64af7c87ee5876829e90ba9fd62fe22c9ba052450872","observation_id":"648ed58d-8c6b-4e0f-af43-7ed09662dc3b","resolution":{"observed_at":"2026-08-06T23:42:41.751835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-06T23:42:40.126961Z","title":"Magicvideo: Efficient video generation with latent diffusion models.CoRR, abs/2211.11018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.126961Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:18434b26aa702084980d6abc1eef20ee8286a705aa66b00fa77a341441df378d","observation_id":"073b2f1d-b80b-4e60-aac7-e1e6132236d0","resolution":{"observed_at":"2026-08-06T23:42:40.126961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.233865Z","title":null,"venue":null,"work_id":"5397c198-a913-4e71-9027-768c87da674b","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.214754Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:07a93e59ec991de84df80aebe8926eb2f09593c8ecc2a6ca341e1a3cf90903b8","observation_id":"2e9389a7-80c6-4e61-b0a4-dc087ac437b5","resolution":{"observed_at":"2026-08-06T23:42:47.308399Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":36,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 1 inbound Pith citation observation for arXiv:2506.16852."}