{"as_of":"2026-08-19T17:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3d963c21bba115e2d150f486606274ca2b3f941ea752365d41d4c7038a7a97b","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:53:11.966188Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:29:41.247052Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T04:46:05.518160Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-07T10:18:23.943246Z","title":"Infp: Audio-driven interactive head generation in dyadic conversations.arXiv preprint arXiv:2412.04037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-18T10:26:01.171354Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.943246Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:90fb7af0fb33869eb270a1129fa98728a8ae00b30a5e498d95213b09054f7207","observation_id":"bc068e31-25cc-4c12-bd41-c1c26721d8de","resolution":{"observed_at":"2026-08-07T10:18:23.943246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-15T18:29:41.247052Z","title":"INFP: Audio- Driven Interactive Head Generation in Dyadic Conversa- tions.arXiv preprint arXiv:2412.04037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19833","last_updated":"2025-06-24T17:50:16Z","snapshot_observed_at":"2026-08-18T10:26:05.461413Z","submitted_at":"2025-06-24T17:50:16Z","title":"Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T18:29:41.247052Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2506.19833"},"observation_digest":"sha256:824f1b7c8576d876f764973fbcd82c5e591e16c434a8b89068fbe6eb02603dc5","observation_id":"65f06d46-f32a-4f29-bb42-726d23356af8","resolution":{"observed_at":"2026-08-15T18:29:41.247052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-06T21:19:17.092084Z","title":"Infp: Audio-driven interactive head generation in dyadic conversations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00472","last_updated":"2025-07-01T06:38:14Z","snapshot_observed_at":"2026-08-13T00:10:14.450963Z","submitted_at":"2025-07-01T06:38:14Z","title":"ARIG: Autoregressive Interactive Head Generation for Real-time Conversations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:17.092084Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2507.00472"},"observation_digest":"sha256:9e99ca8c3346cbbc6df1873745450ef4388e34ff25458474eee09eff099b39bd","observation_id":"3239a036-a110-470e-84cc-4cd7c2e1fd95","resolution":{"observed_at":"2026-08-06T21:19:17.092084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-06T10:58:01.712367Z","title":"INFP: Audio-driven interactive head generation in dyadic conversations.arXiv preprint arXiv:2412.04037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23298","last_updated":"2025-08-04T10:54:09Z","snapshot_observed_at":"2026-08-18T10:24:59.570302Z","submitted_at":"2025-07-31T07:34:32Z","title":"Real-time Generation of Various Types of Nodding for Avatar Attentive Listening System","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:58:01.712367Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2507.23298"},"observation_digest":"sha256:2f1ad8b97852076e0c8faf91fc3b0e1df22b0aaba97219d2c891bc9b7fca92cd","observation_id":"466d4ee9-2b49-4c9d-871e-bd7dd98597c9","resolution":{"observed_at":"2026-08-06T10:58:01.712367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":"2412.04037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-06T04:46:05.518160Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","venue":"cs.CV","work_id":"9cef4404-d312-42b5-81df-115fcbfb1499","year":2024},"citing_paper":{"arxiv_id":"2508.03050","last_updated":"2025-08-05T03:54:18Z","snapshot_observed_at":"2026-08-17T20:51:58.214103Z","submitted_at":"2025-08-05T03:54:18Z","title":"Multi-human Interactive Talking Dataset","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:05.382405Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2508.03050"},"observation_digest":"sha256:bae530d3ebd107c641c4dd40838f997f3e31af480ec06467e417f93d15ce5629","observation_id":"8569be9f-6540-496b-9667-ed88b5a6cfde","resolution":{"observed_at":"2026-08-06T04:46:05.601149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04037/citation-record","integrity":"/paper/2412.04037/integrity","json":"/paper/2412.04037/citation-record.json","paper":"/paper/2412.04037"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.658739Z","title":"Talknet: Fully-convolutional non-autoregressive speech syn- thesis model, 2020","venue":null,"work_id":"a182057b-1757-4220-a3f0-080a6f938a16","year":2020},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.736835Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:89bbeb3ee61f2f98579fe443197a9d53bdc0d24c9b246609edc861845eb464f8","observation_id":"9dfbd778-91a0-4e1a-b756-f41b373cabdb","resolution":{"observed_at":"2026-08-11T21:53:12.662393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-17T16:30:00.213972Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-11T21:53:11.741339Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.741339Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:21c3bc38188e842aac194855dac929d205bec232b1fd2ee934bebf87432eecac","observation_id":"e01a7de3-3a67-43a5-80b4-4f2f332e41cb","resolution":{"observed_at":"2026-08-11T21:53:11.741339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.648429Z","title":null,"venue":null,"work_id":"e3e464f6-4280-45b9-ab05-e419dd6c4906","year":2016},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.745431Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:aab8437a3fafafdfd7075858a7a4a36ffeb1350433e44168b374f06d801f6cfb","observation_id":"8c939fb3-5021-474a-a984-8d0821648288","resolution":{"observed_at":"2026-08-11T21:53:12.651792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.636788Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"3266e093-456d-471e-b6c4-1c02499eed62","year":2019},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.749257Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:b3854e0aa10abb5467f5860acae23b32d16d7b065140eae8948e2b740bd07d3e","observation_id":"1d51c5e5-81bf-4137-86c4-16bb6e96f1b8","resolution":{"observed_at":"2026-08-11T21:53:12.641213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.625230Z","title":"Accurate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":"aca494e6-63de-45cb-8acd-c3f1b415253d","year":2019},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.753360Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:6e20b790c42d232fb868407fb6f1ad469e4b9d0ae867fccfa4adcd4bc1443a97","observation_id":"08c07cb8-55ad-46f0-b586-bd5b8030d8f4","resolution":{"observed_at":"2026-08-11T21:53:12.629328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.613967Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"f95037d3-a62c-4999-a918-218b3fad7dc5","year":null},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.757387Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:b26a8cc0aaa2dd5dc6deb5e8174b947057d01449094f6a6cee0b68be529f3818","observation_id":"af9b6e5d-18ec-444a-84a9-a2c8769f56a4","resolution":{"observed_at":"2026-08-11T21:53:12.617980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11094","last_updated":"2022-07-22T14:07:46Z","snapshot_observed_at":"2026-08-18T11:38:51.011937Z","submitted_at":"2022-07-22T14:07:46Z","title":"Visual Speech-Aware Perceptual 3D Facial Expression Reconstruction from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11094","snapshot_observed_at":"2026-08-11T21:53:11.761550Z","title":"Filntisis, George Retsinas, Foivos Paraperas- Papantoniou, Athanasios Katsamanis, Anastasios Roussos, and Petros Maragos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.761550Z"},"links":{"cited_paper":"/paper/2207.11094","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:0384810741f31711616251fc57dedcb1dfed1cc91bec4bd4f19bc68ff8b191c0","observation_id":"e4c6fd79-5ff4-4c1e-80f9-c40506c89119","resolution":{"observed_at":"2026-08-11T21:53:11.761550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.601576Z","title":"Affective faces for goal-driven dyadic communication","venue":null,"work_id":"3334975f-4dc4-43df-ba98-2419456ce311","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.765905Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:54602db61638b868b391fd27834c9d13299ce2ec583fbfede58587ce5e1653e5","observation_id":"3f5d3a74-cdb1-4e34-8cbe-fce70d047100","resolution":{"observed_at":"2026-08-11T21:53:12.605474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:11.769746Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.769746Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:9f9ae74b2de4f03472871407ca4147da3d6abd5802168b5e37f4428a2defde35","observation_id":"d0a58d21-4ac4-4bf8-a592-1fdf781060f1","resolution":{"observed_at":"2026-08-11T21:53:11.769746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.583742Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":"9c75b2ea-08cd-4852-90ff-010c8ecc841b","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.773705Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:670944acc383286d62780fd1e399d1d6fe8a87d8ccc2245eff14e1fb49b1272c","observation_id":"64457f55-f057-4b5d-9b20-366deb89aea7","resolution":{"observed_at":"2026-08-11T21:53:12.587350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:11.777648Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.777648Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:5d6b13492ac6a9b692bc3dbf9a1ac9ad816f1a5e160df5d88884becaebaaf654","observation_id":"d46729b8-d32c-4717-9bde-47efb366501e","resolution":{"observed_at":"2026-08-11T21:53:11.777648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.566942Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"c336e02a-9437-4071-b48f-e3068badf33b","year":2021},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.781659Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:16dbb6d5b5c3a38f972558721500d009aaa5c958ce8baa26775b9b2860b1aa02","observation_id":"3ea19e3d-1b9a-444c-84f8-3b943d9c3b02","resolution":{"observed_at":"2026-08-11T21:53:12.570776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.556240Z","title":"Percep- tual conversational head generation with regularized driver and enhanced renderer","venue":null,"work_id":"8e571b6d-faa4-4b68-9314-c51ab5e80c30","year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.786102Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:7507f4bf7d3820d37b823cc8d7466237becdfa2e7ba83ce134f91fa59988be6f","observation_id":"4cd2147a-360d-47ac-a1ff-c919f54cc49c","resolution":{"observed_at":"2026-08-11T21:53:12.560307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.545505Z","title":"Interact: Capture and modelling of realistic, ex- pressive and interactive activities between two persons in daily scenarios","venue":null,"work_id":"ebd46abf-4d8a-45c2-80df-0bd71de4b5a6","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.790062Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:38f49cefeda753ee5352db03ec6e19e06fe776aa1be52e36acf3a54624455d68","observation_id":"f876d396-533d-4fa7-a2af-2d1b9e52ea9b","resolution":{"observed_at":"2026-08-11T21:53:12.549397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.532994Z","title":"Analyzing and improving the image quality of StyleGAN","venue":null,"work_id":"bfd0597c-d91a-4e49-a512-6954fd30769e","year":2020},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.793901Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:f7846f574fb8d3e15b2ec6d3f9ec112fc947f3d8a7b73657211cc639a801309b","observation_id":"4c5b979d-c718-4557-a079-32305fd51330","resolution":{"observed_at":"2026-08-11T21:53:12.537303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.520732Z","title":"Mfr-net: Multi-faceted responsive listening head generation via denoising diffusion model","venue":null,"work_id":"50874fd0-65c8-4f8e-859d-8fae29931378","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.798431Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:d865975e9590c0391d119b7372ea1f21b174d4605d755015b17bf7c77baa4b2e","observation_id":"80ee6fb2-eae4-4aa6-93ef-5b5a6110388a","resolution":{"observed_at":"2026-08-11T21:53:12.524818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.507983Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding, 2024","venue":null,"work_id":"06d79461-edaf-4562-809a-369abd41bb3b","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.802718Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:c9f95c7f1411591749b06602e2c794fb1bdc2c03097f8f7f0ae774341aecbf16","observation_id":"0a198528-c71e-4090-b58a-2a5be7fb51e0","resolution":{"observed_at":"2026-08-11T21:53:12.512443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.495576Z","title":"Customlistener: Text-guided responsive inter- action for user-friendly listening head generation","venue":null,"work_id":"9edf08f1-f1c0-41de-8b39-bc442d82c30e","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.806502Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:766f0d9e22717da5a3cec31539486be92c5a023e00c40282bd0dd7f6ebaccc6e","observation_id":"1bcd68d9-ed2a-4e36-b3a7-d0d0cf83888f","resolution":{"observed_at":"2026-08-11T21:53:12.500099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:11.810244Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.810244Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:255bb720b0eb07aac40c3feaac1e57b30ac5f111c996a340fc3fa723aa8bdc8f","observation_id":"92457ba9-b2f2-426b-b2e2-a57c29c27bdf","resolution":{"observed_at":"2026-08-11T21:53:11.810244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.474816Z","title":"Mediapipe: A framework for perceiving and processing reality","venue":null,"work_id":"7227f0f9-a017-4105-97ce-bf9fe245fbdc","year":2019},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.814002Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:72180364f84db0d67c34d94a66d09ad4070c73f3c4761dc0ed5b1c4cbea4f58a","observation_id":"4d2cc443-95cc-4ba6-b0e8-8f657a0ff0fa","resolution":{"observed_at":"2026-08-11T21:53:12.478745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.462129Z","title":"Styletalk: one-shot talking head generation with controllable speaking styles","venue":null,"work_id":"407ee326-85c5-4f82-b2de-5595bef12f40","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.817967Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:79cfa45c3629d616605f18db4f43206e6963880cb84819e8ea6461338519fe18","observation_id":"17a75fd3-f8c2-4b18-9369-64d289ad0d98","resolution":{"observed_at":"2026-08-11T21:53:12.466465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-08-18T14:57:45.246060Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-08-11T21:53:11.821517Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.821517Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:ac608c42221134f63f19f855e8f30acbed036dd0cfdcedeecc9cbd846a177dd4","observation_id":"90b8a417-58e2-4082-a8b7-fb75f5d16a88","resolution":{"observed_at":"2026-08-11T21:53:11.821517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.451564Z","title":"Learning to listen: Modeling non-deterministic dyadic facial motion","venue":null,"work_id":"f07a83db-cab6-4b68-b62b-224add2351e7","year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.826076Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:1f63c9b55c0571e3597b62a662299ba811d5f8dba0fbedca37a8de03395c159b","observation_id":"c3b53312-fc9d-4762-b338-396a61ab3e84","resolution":{"observed_at":"2026-08-11T21:53:12.455133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.441778Z","title":"Can language 9 models learn to listen? In Proceedings of the IEEE/CVF In- ternational Conference on Computer Vision , pages 10083– 10093, 2023","venue":null,"work_id":"5315fab3-de27-4101-8a0a-db20b009c2e4","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.829510Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:4914119457ad385c03b496bb023766180310400e43f3b79489f3ca30818b1a45","observation_id":"34ff912f-bca7-4d07-8d0f-a8975091555f","resolution":{"observed_at":"2026-08-11T21:53:12.445047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:11.832950Z","title":"From audio to photoreal embodiment: Synthesizing humans in conversations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.832950Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:c260a82653bb1daf298f93d6b8f2173c711d7bb67c9ff6a9fae72287b1c33c4e","observation_id":"1bb1ca10-fd45-4e29-b21e-510fe3a8ceb7","resolution":{"observed_at":"2026-08-11T21:53:11.832950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07867","last_updated":"2024-08-02T15:05:47Z","snapshot_observed_at":"2026-08-16T13:43:55.179056Z","submitted_at":"2024-06-12T04:48:36Z","title":"Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07867","snapshot_observed_at":"2026-08-11T21:53:11.836010Z","title":"Let’s go real talk: Spoken dialogue model for face-to-face conversa- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.836010Z"},"links":{"cited_paper":"/paper/2406.07867","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:fa5c7b7160bbb557625bbbdc4a490956e6e8c3076e87a71a38530d474877f12f","observation_id":"828926df-fee3-4fa5-aa54-cc8362e75f70","resolution":{"observed_at":"2026-08-11T21:53:11.836010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.426534Z","title":"Nambood- iri, and C.V","venue":null,"work_id":"65a0b5ec-8918-40bc-8eac-1c862b2d8c48","year":2020},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.839810Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:2b94e0b3052c8a2c4661c88b045d920a5103d8f112284bb69e20baad7a3e9a59","observation_id":"26962c05-95d5-4fc1-ab7c-e7f69bf8a61a","resolution":{"observed_at":"2026-08-11T21:53:12.429424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.416123Z","title":"Li, and Shan Liu","venue":null,"work_id":"def77314-cc01-4c3e-b840-c7c6dc4f43bd","year":2021},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.843204Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:095e3bff8a143f6b5fff6b8b965218297612628de31141724da1f841346aa358","observation_id":"4167e2e0-7650-4ac9-ae74-1d60ebefa28e","resolution":{"observed_at":"2026-08-11T21:53:12.419924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.402504Z","title":"High-resolution image syn- thesis with latent diffusion models, 2021","venue":null,"work_id":"972179ff-fed0-497a-b30b-0c3ab76c8451","year":2021},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.846509Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:f53fc35d12f3c548824ebc680fbb8da3116002678ac01b58a92233e83ed9abde","observation_id":"00fd7ca6-e607-405b-8a26-32954fd78f03","resolution":{"observed_at":"2026-08-11T21:53:12.407735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T21:53:11.849442Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.849442Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:d9164af32c669288c38750448c179329d0b6c7495350252d47381be88665b347","observation_id":"c1e83505-e230-48f0-9ace-d61588619bd3","resolution":{"observed_at":"2026-08-11T21:53:11.849442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.390480Z","title":"Emotional listener portrait: Realistic listener motion simulation in conversation","venue":null,"work_id":"16595f34-dc7a-442e-8976-6b5a021a4257","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.853496Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:64d8c5b121b0b4c0ade326ed85d14f0cf05f124897bae9e5c43724e9572c86d0","observation_id":"5ba9a542-de87-4e9b-8dc8-2bb4b7183f42","resolution":{"observed_at":"2026-08-11T21:53:12.394845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.378967Z","title":"React 2024: the second multiple appropriate facial reaction generation challenge, 2024","venue":null,"work_id":"926b9715-1aeb-49f0-9e88-c8c5fa875587","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.857028Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:c89b0987ba97df235aaee718976fa00e073f3fcd43cb92c4a06c9dc45d1acf35","observation_id":"f49d2435-db0a-451f-8d7c-0425748ea3b4","resolution":{"observed_at":"2026-08-11T21:53:12.383278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.366143Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":"cd921f6e-b375-4246-bfb6-f3df161b80fb","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.860695Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:d73710d6b44ed9e07acbc26625a260b7f7c333997885b7e28fc4dc34d8eb86f2","observation_id":"44fce604-1b28-4b16-a51f-e5b43513cf80","resolution":{"observed_at":"2026-08-11T21:53:12.370436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19467","last_updated":"2024-03-28T14:47:32Z","snapshot_observed_at":"2026-08-17T04:33:04.149959Z","submitted_at":"2024-03-28T14:47:32Z","title":"Beyond Talking -- Generating Holistic 3D Human Dyadic Motion for Communication","version":1},"cited_work":{"arxiv_id":"2403.19467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.19467","snapshot_observed_at":"2026-08-11T21:53:12.131932Z","title":"Beyond Talking -- Generating Holistic 3D Human Dyadic Motion for Communication","venue":"cs.CV","work_id":"54fefbf7-9dba-4fbb-ba11-1006a64915b1","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.864164Z"},"links":{"cited_paper":"/paper/2403.19467","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:8f7304e708017afead8f2be98aaddb181ad72660ed0bd7f8f2e8175e54c06d6e","observation_id":"bc4d08c7-6a15-489d-845c-6610fe9d8394","resolution":{"observed_at":"2026-08-11T21:53:12.138969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.354487Z","title":"Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models","venue":null,"work_id":"ca4bf43f-163c-404d-93cf-d31fb6c888cb","year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.868282Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:be1aa5a6835a4f85b337214efeba1f8dc25618c665ab4fcee2a28cba47157594","observation_id":"c36eb33e-eb22-470d-aa2f-1244e748e648","resolution":{"observed_at":"2026-08-11T21:53:12.358339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-19T11:13:23.284476Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-11T21:53:11.871802Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.871802Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:5cadc96fe023b818ac9664847c505f7aed897dce5e3705dba07ab44977b3b915","observation_id":"b7ae3069-786c-4293-940e-d229b14366d4","resolution":{"observed_at":"2026-08-11T21:53:11.871802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-08-16T14:14:55.263652Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-11T21:53:11.875876Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.875876Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:1e5cce213c10535a16092573ec75ab313b9a23c9d32f079230d71b154a17507b","observation_id":"5422135d-daf7-4ae8-9c3f-f71349a2abcb","resolution":{"observed_at":"2026-08-11T21:53:11.875876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-16T09:10:10.815975Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-11T21:53:11.879569Z","title":"The information bottleneck method","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.879569Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:74ab4691e13738ca5c5f9511caa5be94cd10ba3f87734444d21164dcfaae3d13","observation_id":"44299887-66e1-4064-9b30-a94d1897ee86","resolution":{"observed_at":"2026-08-11T21:53:11.879569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09069","last_updated":"2024-07-17T21:53:41Z","snapshot_observed_at":"2026-08-16T14:09:58.805440Z","submitted_at":"2024-03-14T03:21:33Z","title":"Dyadic Interaction Modeling for Social Behavior Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09069","snapshot_observed_at":"2026-08-11T21:53:11.883377Z","title":"Dyadic interaction modeling for social behavior generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.883377Z"},"links":{"cited_paper":"/paper/2403.09069","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:ed0e654300647835266e4838132a53a082b995c4aba4cc49beb8e34538f4bb3a","observation_id":"15856dd0-0eb4-4200-8c0a-0fe06384bf69","resolution":{"observed_at":"2026-08-11T21:53:11.883377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:11.887127Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.887127Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:33e6db01d4f9803ecaa0dd1f93f663c200ec8c3352b5f4a657ced617eed67d9e","observation_id":"f55b42de-9ac8-47a2-a1f2-d080df0dae48","resolution":{"observed_at":"2026-08-11T21:53:11.887127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-08-19T07:28:01.288662Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-11T21:53:11.890901Z","title":"V-express: Conditional dropout for progres- sive training of portrait video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.890901Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:408fdcaacaab39d290cf94a42d2081ec6aeddd416eb1a344327f4f14d9339d0e","observation_id":"38bd2266-8725-4b43-b102-90c96203977f","resolution":{"observed_at":"2026-08-11T21:53:11.890901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.338174Z","title":"Dis- entangling planning, driving and rendering for photorealistic avatar agents","venue":null,"work_id":"38ec8138-2a7b-4952-8412-6492f9b86fdf","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.895026Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:cac28a1f672c5fb3fd19c9bd28577a30033bf1deb2c451bd6957529d3596d479","observation_id":"5b61c8f8-b7cb-4adb-beca-738db3cbe68f","resolution":{"observed_at":"2026-08-11T21:53:12.341725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.327586Z","title":"Progressive disentangled representation learning for fine-grained controllable talking head synthesis","venue":null,"work_id":"7df672ce-d520-405f-8375-d142c1bd6ee2","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.898857Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:782a8b3cd4837b70189092fe7bac31fe0732d48f3a11b2057d14afd092d206aa","observation_id":"fb60fb04-14c2-42f7-a499-1b56bb6f36da","resolution":{"observed_at":"2026-08-11T21:53:12.331269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09043","last_updated":"2022-03-17T02:45:34Z","snapshot_observed_at":"2026-08-16T17:13:55.234953Z","submitted_at":"2022-03-17T02:45:34Z","title":"Latent Image Animator: Learning to Animate Images via Latent Space Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09043","snapshot_observed_at":"2026-08-11T21:53:11.902478Z","title":"Latent image animator: Learning to ani- mate images via latent space navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.902478Z"},"links":{"cited_paper":"/paper/2203.09043","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:ad6d236ff02b3f80880c850446094e8868d1172b6759b0f0769ea43c3a7ebbdf","observation_id":"c4bf814d-f4fb-4ae2-a766-52e77c0130c6","resolution":{"observed_at":"2026-08-11T21:53:11.902478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-18T10:23:27.377504Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-11T21:53:11.906895Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.906895Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:c40d6ab488e53cc4a2eaa17eee71256d3346ec8d3ef54aae611f242f172e96dc","observation_id":"3dc37f7c-6fb2-4cbf-b667-81018ea390d6","resolution":{"observed_at":"2026-08-11T21:53:11.906895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-08-16T14:00:25.942097Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-11T21:53:11.911780Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.911780Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:cbe3890f54a1b781cdc608a5af5706a75228460579d59fc9ef3680caed9861fc","observation_id":"190e1e3a-50df-4b69-a36a-75126bd6c944","resolution":{"observed_at":"2026-08-11T21:53:11.911780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.316798Z","title":"Dialoguenerf: Towards realistic avatar face- to-face conversation video generation, 2023","venue":null,"work_id":"36b9041c-9c03-421d-8366-e2d39ee8c75a","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.916197Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:bb5c9fa4fab23f58bcd01014ab4b051f89c9e01eab1745d4443c4b89adf0e97e","observation_id":"2f065508-d3ba-46c9-9ade-ff4086ac8fe5","resolution":{"observed_at":"2026-08-11T21:53:12.320642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13578","last_updated":"2023-12-21T05:03:18Z","snapshot_observed_at":"2026-08-18T10:22:53.196015Z","submitted_at":"2023-12-21T05:03:18Z","title":"DREAM-Talk: Diffusion-based Realistic Emotional Audio-driven Method for Single Image Talking Face Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13578","snapshot_observed_at":"2026-08-11T21:53:11.920401Z","title":"Dream-talk: diffusion-based realistic emotional audio-driven method for single image talking face generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.920401Z"},"links":{"cited_paper":"/paper/2312.13578","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:073ab974779336f5b2f8018638c4130392e9fbefed13ad0e6b52159462981094","observation_id":"d274d88d-da5d-4bc9-a55b-d7a30f776d41","resolution":{"observed_at":"2026-08-11T21:53:11.920401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05379","last_updated":"2024-09-09T07:23:28Z","snapshot_observed_at":"2026-08-16T13:20:18.149782Z","submitted_at":"2024-09-09T07:23:28Z","title":"PersonaTalk: Bring Attention to Your Persona in Visual Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05379","snapshot_observed_at":"2026-08-11T21:53:11.924761Z","title":"Personatalk: Bring attention to your persona in visual dubbing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.924761Z"},"links":{"cited_paper":"/paper/2409.05379","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:29afd710b90fee3fb2729005f04300bd3a2ec67d96fbb58d4b9ed4a825e7913e","observation_id":"d59b9a30-b0f5-4193-9e94-cdbed22f3d6d","resolution":{"observed_at":"2026-08-11T21:53:11.924761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:11.928742Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.928742Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:2a802859d915b0c4106ac94b9e0a7b61bb7a013d2ca602b4be0a6232a41b2122","observation_id":"337fa33e-41e9-4670-bb57-838f5fff805f","resolution":{"observed_at":"2026-08-11T21:53:11.928742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.299324Z","title":null,"venue":null,"work_id":"085e1d41-3bbc-44bd-88c1-5b3eb8060357","year":2017},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.932444Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:bb54f0eb68d3992768e054b937186c423f033d22f5b1a5e38f37e0c4adfa90a5","observation_id":"d69ba8ac-5856-4051-abbf-0a4f49d87ea5","resolution":{"observed_at":"2026-08-11T21:53:12.302455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.287125Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"a4946ba9-6b1f-45d3-959e-5a648ab2f1c5","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.935710Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:5b470e01423b9f1180040bcdefcc7ab60ca51f66b5329caed3656374ee5bce79","observation_id":"ec525900-31ea-4a90-a3fc-7c55d91ef699","resolution":{"observed_at":"2026-08-11T21:53:12.291723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.277413Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"9a317843-d244-4b29-8389-7be28e6092ab","year":2021},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.939319Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:4b972f3e2b22d223fca37e2efcf5da23815e68ea3e7e86c328b7cbb20a2dee73","observation_id":"9d72ee49-1f4e-44a9-88b4-b06b855aac9a","resolution":{"observed_at":"2026-08-11T21:53:12.280781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.266266Z","title":"Mossformer2: Combining transformer and rnn-free recurrent network for enhanced time-domain monaural speech separation, 2023","venue":null,"work_id":"9cf40f81-7e3c-4eba-8cd1-6e7cec806675","year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.942072Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:bcb4ce5d32a24b64c3879cb81c764943577d24b84fd2922a8ceb59da19816d00","observation_id":"cba50b78-9cf3-4440-8865-b82f94135e34","resolution":{"observed_at":"2026-08-11T21:53:12.270963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.254663Z","title":"Semantic-aware responsive listener head syn- thesis","venue":null,"work_id":"47d8a7ea-c052-438a-a6e2-c5901a0cc94e","year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.944923Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:18df0427942da2889a061da621dcad2b34cc511542142e0c480664fa25a21c33","observation_id":"e01301c8-85e0-43fd-95db-9deb7568ab80","resolution":{"observed_at":"2026-08-11T21:53:12.258543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.242887Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":"9c5eae49-ddfa-433d-aa48-f806ff2bac57","year":2021},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.948116Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:5156b90942b5a4545065d5ad77ad5f87c7b908f49b0e4597bf9f69a1811d098f","observation_id":"ea97939c-5eeb-4b4e-96d6-562d765352ff","resolution":{"observed_at":"2026-08-11T21:53:12.246872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.231941Z","title":"Vico-x: Multimodal conversation dataset","venue":null,"work_id":"30cdfa64-900e-4d27-82ce-738a7bd9a1e9","year":null},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.951252Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:6c2edecc794bb16c457bfb40a9cfe85b2d3e468cae216ce96eaa4e8f6e8d1232","observation_id":"7a6df66d-d046-4ea9-97dd-b41d5db23498","resolution":{"observed_at":"2026-08-11T21:53:12.235650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.208828Z","title":"Responsive listening head generation: A benchmark dataset and baseline","venue":null,"work_id":"95f6a3af-770c-4f6d-a90a-03c58617c4a2","year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.958153Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:91e87e59732c586df2ba953d5719630b86e385ce305a71779685c93a7fc9851a","observation_id":"38ddad94-5703-4d7c-a4fe-5dbafca72a3e","resolution":{"observed_at":"2026-08-11T21:53:12.213548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02090","last_updated":"2023-07-05T08:06:26Z","snapshot_observed_at":"2026-08-16T15:18:39.567453Z","submitted_at":"2023-07-05T08:06:26Z","title":"Interactive Conversational Head Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02090","snapshot_observed_at":"2026-08-11T21:53:11.961583Z","title":"Interactive conversational head generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.961583Z"},"links":{"cited_paper":"/paper/2307.02090","citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:705533cc6773be9565e2ad354332aaefc567a1145e1b7f3bdf9afc43cc786c2d","observation_id":"aea57f22-9287-4d71-8a75-dc7fa33b229c","resolution":{"observed_at":"2026-08-11T21:53:11.961583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.196615Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"947b1cdf-e0df-4b0d-b497-41f787991bc4","year":2020},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.966188Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:5148433e600d9ac2381e706ae0b7f2f69aeac3487da18c22b2dc9bb7e6043932","observation_id":"21ee5012-1755-4aec-a448-072998ad928d","resolution":{"observed_at":"2026-08-11T21:53:12.200475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:53:12.221112Z","title":null,"venue":null,"work_id":"f3d29185-a0e8-4a0d-85b1-5603ec6faacd","year":2022},"citing_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T21:53:11.954498Z"},"links":{"citing_paper":"/paper/2412.04037"},"observation_digest":"sha256:0cccda50c85c0a481426f9268c897a991491abc895c685c807dec66df3175018","observation_id":"b748deca-3023-4fc7-a8a8-84f33a166cc1","resolution":{"observed_at":"2026-08-11T21:53:12.224929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:23:25.989962Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 5 inbound Pith citation observations for arXiv:2412.04037."}