{"as_of":"2026-08-18T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6379ea48959957d1e8b3530a36925ef6a8a4dd94920f31eced51832973c848d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:13.746751Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18096/citation-record","integrity":"/paper/2505.18096/integrity","json":"/paper/2505.18096/citation-record.json","paper":"/paper/2505.18096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:23.903021Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations.Advances in neural infor- mation processing systems, 33:12449–12460, 2020","venue":null,"work_id":"c27b8438-5b72-4bfe-80e9-17ce34989a54","year":2020},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.664873Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:968a8b096bd0d4f085def52ab3fe657d07a6755a6121ec0e30ef17cd8c21d84a","observation_id":"d3b796bc-c835-4589-85c3-27c5b74dad10","resolution":{"observed_at":"2026-08-07T14:39:24.059388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:23.597691Z","title":"High-fidelity fa- cial avatar reconstruction from monocular video with gen- erative priors","venue":null,"work_id":"b4ad5f02-d74a-4deb-aa23-4c44e3d8bafc","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.727929Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:52fac203865747beedd0c68f4c97ee4d1b77407cef9a1d8a557b89015dbc55bd","observation_id":"06a19676-da99-4faa-b7bf-e69fd9de279f","resolution":{"observed_at":"2026-08-07T14:39:23.759935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:23.201277Z","title":"Pyannote","venue":null,"work_id":"6e099a3d-87be-4bcb-b981-c236ab64a6cd","year":2020},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.854167Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:2950b520373ab92cebb14b512ae9e3687e551ada288cc0198d30a7be070a495f","observation_id":"ff12b923-45aa-4306-a924-592a3dcc8f5a","resolution":{"observed_at":"2026-08-07T14:39:23.359982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:22.856676Z","title":"Expressive speech-driven facial animation.ACM Transactions on Graphics (TOG), 24(4):1283–1302, 2005","venue":null,"work_id":"4016d554-ff51-4956-be25-f3d729604e43","year":2005},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:06.984124Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:cd8790ed157fb704d0c34ee3947498ee9b3c9c0a8c4eb7be021e2cdb4b3e2f99","observation_id":"84ff27c2-43a8-4706-a46d-1e6bacefe58d","resolution":{"observed_at":"2026-08-07T14:39:23.050517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:22.500221Z","title":"Human conversation as a system framework: Designing embodied conversational agents.Em- bodied conversational agents, pages 29–63, 2000","venue":null,"work_id":"2f94e221-8105-4d58-a389-c1a60dd2d18e","year":2000},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.100300Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:2864c3d5da07fc35ecf40b6c2aa5355977eada41c2756c42d92f5cb5b000d54b","observation_id":"3f2b911b-466e-4456-ba0a-cab1070360c2","resolution":{"observed_at":"2026-08-07T14:39:22.655777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:22.230657Z","title":"Cafe-talk: Generating 3d talking face animation with mul- timodal coarse-and fine-grained control","venue":null,"work_id":"27ee7824-f4bd-4bb1-9a0c-365b17230497","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.224197Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3384b36ac1fc18f7aba8f78baf7390422635e1fa2e90a07937df81ec47a6835e","observation_id":"c4643fe1-6037-4362-b040-2837c21949fe","resolution":{"observed_at":"2026-08-07T14:39:22.372229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.807957Z","title":"Capture, learning, and synthe- sis of 3d speaking styles","venue":null,"work_id":"e4ab509c-06bb-4ef6-8836-067dd2a6e5a9","year":2019},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.362385Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:0ad01305e79582b29163169d4e4ab25f600f8790595fef64db00fd43e1508d7b","observation_id":"fd2b9128-deaf-4bc0-a755-0d6898416b8a","resolution":{"observed_at":"2026-08-07T14:39:22.019144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.592592Z","title":null,"venue":null,"work_id":"6122b01b-5ed5-46d0-9dbb-ca4f1e8879de","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.466214Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:bd378d09d1128a901677de174b25c63462b9e36bba499e29c564c9252ad65245","observation_id":"8d7d3b56-896f-4f2f-8a5a-3977234923ad","resolution":{"observed_at":"2026-08-07T14:39:21.672545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00762","last_updated":"2024-08-01T17:59:27Z","snapshot_observed_at":"2026-08-16T13:29:08.543806Z","submitted_at":"2024-08-01T17:59:27Z","title":"UniTalker: Scaling up Audio-Driven 3D Facial Animation through A Unified Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00762","snapshot_observed_at":"2026-08-07T14:39:07.573603Z","title":"Unitalker: Scaling up audio-driven 3d facial animation through a unified model.arXiv preprint arXiv:2408.00762,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.573603Z"},"links":{"cited_paper":"/paper/2408.00762","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:dd4aefc01fef120447898777272dca73a3cb8879705d7d2723ded8a9db42b3f4","observation_id":"dfd6207e-f5b7-464a-90d4-e2c7fbae2d00","resolution":{"observed_at":"2026-08-07T14:39:07.573603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.456649Z","title":"Faceformer: Speech-driven 3d facial anima- tion with transformers","venue":null,"work_id":"62b1cdee-60f6-4f54-af84-e0b6aa59019e","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.722156Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:05d4cc3c33f7fcdd607b6951f72f5ec67a00fcbb7beb3c66c6ee7b8dbd59640e","observation_id":"4827c36e-ac0c-4dd1-970f-f3ce33a5c38a","resolution":{"observed_at":"2026-08-07T14:39:21.535978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.315440Z","title":"A 3-d audio-visual corpus of af- fective communication.IEEE Transactions on Multimedia, 12(6):591–598, 2010","venue":null,"work_id":"0dfe71a2-375b-4285-81f7-ef9d2941b795","year":2010},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.853427Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:48d6bbd958c9e0b0e4ce4ac52dbe7834d2a883667cb4dc8960d2fdd5eb873e92","observation_id":"7cc3a6c8-ad41-4a75-8f5a-08ec483ea04b","resolution":{"observed_at":"2026-08-07T14:39:21.366870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10939","last_updated":"2023-01-26T05:00:09Z","snapshot_observed_at":"2026-08-16T16:00:04.764118Z","submitted_at":"2023-01-26T05:00:09Z","title":"Affective Faces for Goal-Driven Dyadic Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10939","snapshot_observed_at":"2026-08-07T14:39:07.961032Z","title":"Affective faces for goal-driven dyadic communication.arXiv preprint arXiv:2301.10939, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:07.961032Z"},"links":{"cited_paper":"/paper/2301.10939","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:04e93dd10218bfe809a8cf9e6701e1d152f9cb7943b008a581486e8cea09630e","observation_id":"55544b14-4360-47ec-b385-6c9b16d8e246","resolution":{"observed_at":"2026-08-07T14:39:07.961032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16041","last_updated":"2026-07-07T09:51:43Z","snapshot_observed_at":"2026-08-16T15:04:36.261911Z","submitted_at":"2023-08-30T14:00:48Z","title":"From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16041","snapshot_observed_at":"2026-08-07T14:39:08.118474Z","title":"From pixels to portraits: A comprehensive survey of talking head generation tech- niques and applications.arXiv preprint arXiv:2308.16041,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.118474Z"},"links":{"cited_paper":"/paper/2308.16041","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:16989cfd6d224b68867d5b5998fa31f901be457fec8f2421ae2909453642322b","observation_id":"eddc3004-6431-47f9-8f8d-d31ca1d0e223","resolution":{"observed_at":"2026-08-07T14:39:08.118474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:21.092796Z","title":"Long short-term memory.Neural Computation MIT-Press, 1997","venue":null,"work_id":"15fd019d-86db-465a-a75c-984e2f21cb6c","year":1997},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.246824Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:d7f65f110e6d87d7aead3ec44b092f5ed702b36abe5b96ee8345319d984d2efd","observation_id":"ca303e15-0c16-4bb4-be8e-e2eac657cb9a","resolution":{"observed_at":"2026-08-07T14:39:21.231329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.871353Z","title":"Toward rnn based micro non-verbal behavior generation for virtual listener agents","venue":null,"work_id":"7ca9c7f9-4f83-4530-adf5-fe6627551a3d","year":2019},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.357873Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:a4a4ab06f8b262e1f52b29325a32f3806c009210f9254e0d5ba21c4bd1762d93","observation_id":"3f0ddd31-29ba-466f-b13e-f4d3ebfcf144","resolution":{"observed_at":"2026-08-07T14:39:20.979997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.474671Z","title":"Audio-driven facial animation by joint end- to-end learning of pose and emotion.ACM Transactions on Graphics (TOG), 36(4):1–12, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.474671Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:1b5c930cf44e279526517cc1d250764236ddb339a0e2f39401458a1beb8eb0ea","observation_id":"6309504b-f066-41d6-953b-f129ecc8e25b","resolution":{"observed_at":"2026-08-07T14:39:08.474671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:39:08.615584Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.615584Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:1d5cccb82333152dd3be8815018351cec1b2d39e6a5c1df6d7f2683765973834","observation_id":"7ef5a1c9-c907-4aac-9f80-de3e4a631326","resolution":{"observed_at":"2026-08-07T14:39:08.615584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.630308Z","title":"Iianet: An intra-and inter-modality attention network for audio- visual speech separation","venue":null,"work_id":"5061be30-d4d2-45fe-a28a-98a57cb941b2","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.753831Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:064012555557627e6a5645e4c3ee2e9d655b6182b4cdda6e180345e869b9eda1","observation_id":"a180a451-e273-4a16-9e5e-ae34426f373f","resolution":{"observed_at":"2026-08-07T14:39:20.711792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.389986Z","title":"Learning a model of facial shape and expression from 4d scans.ACM Trans","venue":null,"work_id":"061d5175-f623-4226-9783-fed0dfcf693c","year":2017},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.849891Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:73ff78460887542b3628f5544935b7ba40c55918b524d69b605dcb8551f43a8d","observation_id":"29ff24c6-5222-46b6-941d-14e1c6653dd4","resolution":{"observed_at":"2026-08-07T14:39:20.498754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:20.076558Z","title":"One-shot high-fidelity talking- head synthesis with deformable neural radiance field","venue":null,"work_id":"b53c47a4-197d-428c-a5fb-cb161bc7225b","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:08.936420Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:784bf3cfaddeee512a33df4e6138cf1fcb85594f014289f2dce5a59a6cc87a4b","observation_id":"4d1a5a81-b6b6-4ed5-894c-c1e9831dc938","resolution":{"observed_at":"2026-08-07T14:39:20.205414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.878969Z","title":"Proactive con- versational agents in the post-chatgpt world","venue":null,"work_id":"2b1d0684-3039-42db-8e70-c99e8344f75f","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.113832Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:157f9bc41c29caf009d77c4a8dce549c8047b6b402c9bb991c080c7359e1aff6","observation_id":"7b4f4828-477d-4500-9c81-0c5ef5543cc2","resolution":{"observed_at":"2026-08-07T14:39:19.990434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.640457Z","title":"Mfr-net: Multi-faceted responsive listening head generation via denoising diffusion model","venue":null,"work_id":"89925050-3544-4dd1-ba1b-37ea9f4e8e6b","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.273424Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:02df64a2d58a7e7cd40bdef17ea637253c3b38c9956bd5d0b4478a8971a6327f","observation_id":"d54a3abc-70b4-4dbc-b34d-9f4fd95a92ca","resolution":{"observed_at":"2026-08-07T14:39:19.774491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.429651Z","title":"Customlistener: Text-guided responsive inter- action for user-friendly listening head generation","venue":null,"work_id":"41014589-256c-48d8-bedc-25678af0fb29","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.391277Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:188dd75a5ad0341d40477ed01edf308588068e7beccacd7e19c0966582893136","observation_id":"7eaf8bea-ed03-437c-af30-c8df55ba20ab","resolution":{"observed_at":"2026-08-07T14:39:19.530943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-15T17:22:09.610128Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T14:39:09.516177Z","title":"Medi- apipe: A framework for building perception pipelines.arXiv preprint arXiv:1906.08172, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.516177Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:d190e8e686a5519c0c79c23b289948154df5eaa0633775206f04773daad26974","observation_id":"5644a605-6430-4064-a6ec-56219208bce4","resolution":{"observed_at":"2026-08-07T14:39:09.516177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15748","last_updated":"2024-11-04T00:48:12Z","snapshot_observed_at":"2026-08-16T22:35:40.044652Z","submitted_at":"2023-05-25T05:55:53Z","title":"ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions","version":2},"cited_work":{"arxiv_id":"2305.15748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15748","snapshot_observed_at":"2026-08-07T14:39:13.965840Z","title":"ReactFace: Online Multiple Appropriate Facial Reaction Generation in Dyadic Interactions","venue":"cs.CV","work_id":"ffced95d-938b-4538-b89b-d8d508bd8df3","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.681648Z"},"links":{"cited_paper":"/paper/2305.15748","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:191619004f3e2b031462763599a519a2127663c124ac0faf83678a2679e6ca02","observation_id":"4abc0771-f79b-42ec-9f2a-145e8594ce56","resolution":{"observed_at":"2026-08-07T14:39:14.078463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05712","last_updated":"2024-02-08T14:39:16Z","snapshot_observed_at":"2026-08-16T14:20:12.826415Z","submitted_at":"2024-02-08T14:39:16Z","title":"DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05712","snapshot_observed_at":"2026-08-07T14:39:09.795467Z","title":"Diffspeaker: Speech-driven 3d facial animation with diffusion transformer.arXiv preprint arXiv:2402.05712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.795467Z"},"links":{"cited_paper":"/paper/2402.05712","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:9a983f29743e2ea117b260b8f08e10572d6083f62d7824cf126a4642e915f8e2","observation_id":"474495de-3784-412f-b3f0-820278826618","resolution":{"observed_at":"2026-08-07T14:39:09.795467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:19.168176Z","title":"Learning to listen: Modeling non-deterministic dyadic facial motion","venue":null,"work_id":"8212cf2a-5204-4e8f-8afd-8013bf8b0c34","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:09.900396Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:274b24355642f740c49c1d0ef0f5a7ac1c7b75dcaff8f37c599519b85c0e843e","observation_id":"323b7c63-c06b-4cf7-af42-8cf5fb3c9973","resolution":{"observed_at":"2026-08-07T14:39:19.277225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.956243Z","title":"Can language models learn to listen? InProceedings of the IEEE/CVF In- ternational Conference on Computer Vision, pages 10083– 10093, 2023","venue":null,"work_id":"82485a33-df7a-406f-9d5a-bb10cb2498b5","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.012426Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:e5ad294835658a9de20779703f191d2f79a4068e866b357c7f855b07862a110b","observation_id":"3edcf984-b1f2-4670-b137-3871b492d646","resolution":{"observed_at":"2026-08-07T14:39:19.076045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.688744Z","title":"From audio to photoreal embodiment: Synthesizing humans in conversations","venue":null,"work_id":"be1047c6-d97f-45c1-b5c5-ee125677f220","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.117617Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:9df27bea6d72582f9fbe98d5424d8303fce14ae6d54aaf32ca5b6ae722266b0f","observation_id":"6149e777-ba56-4bfb-ab1c-234408708823","resolution":{"observed_at":"2026-08-07T14:39:18.821438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.470728Z","title":"Real-time 3d talking head from a synthetic viseme dataset","venue":null,"work_id":"b5144041-beea-403b-a471-906aa969b36e","year":2009},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.259878Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4303599eb10eedb0876e24c969b9acfbe60885cb30f2511aee5d37580603379b","observation_id":"2d384c6f-2910-4821-bb5d-474f55be4d64","resolution":{"observed_at":"2026-08-07T14:39:18.577419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10942","last_updated":"2024-09-25T09:42:45Z","snapshot_observed_at":"2026-08-16T14:09:12.277470Z","submitted_at":"2024-03-16T14:58:58Z","title":"ScanTalk: 3D Talking Heads from Unregistered Scans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10942","snapshot_observed_at":"2026-08-07T14:39:10.356811Z","title":"Scantalk: 3d talking heads from unregistered scans.arXiv preprint arXiv:2403.10942, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.356811Z"},"links":{"cited_paper":"/paper/2403.10942","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:1650cfa979696747afd72f3dfc340f4eae2d76204ff795b257768c87bf072c6f","observation_id":"298d4bb5-b1bd-42a8-bfd0-31f5d2d268f1","resolution":{"observed_at":"2026-08-07T14:39:10.356811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.470371Z","title":"Dpe: Dis- entanglement of pose and expression for general video por- trait editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.470371Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:bf60b3879831e503c19c60fd72c8b16f59dff656641f8d25edf2c74ff88f6919","observation_id":"22857179-683d-4e48-a559-6bea681d0ce2","resolution":{"observed_at":"2026-08-07T14:39:10.470371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.245434Z","title":"Selftalk: A self- supervised commutative training diagram to comprehend 3d talking faces","venue":null,"work_id":"271b3f8d-9b49-4246-b89d-0afa4f75bfb8","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.596544Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3ec12276e13b9b8c330638d4291c17401b443f9ac42b267dfa13135c47af064b","observation_id":"b777e672-7a0f-4494-b473-a645593ed547","resolution":{"observed_at":"2026-08-07T14:39:18.342972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:18.048949Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face anima- tion","venue":null,"work_id":"5932ce0e-3caa-4fc1-b536-e70cc8c44ec1","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.717041Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b432222b2c0a48e175c3ef29b48a48f4a6fc55b70a84c84946f5428685e6649e","observation_id":"cf1bd416-72da-4c94-bef3-b8f3d1f3b6c9","resolution":{"observed_at":"2026-08-07T14:39:18.136046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.813282Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":"0b6e7dca-7a42-4426-9f7a-6379cca65d19","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:10.847276Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4b7695c06a16122f9bfe663db615f6f2d7d06e9193acc69d361e2da914ae909c","observation_id":"3b82443b-c7d1-49ac-a94f-fbc492e180dd","resolution":{"observed_at":"2026-08-07T14:39:17.923327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.558430Z","title":"Meshtalk: 3d face an- imation from speech using cross-modality disentanglement","venue":null,"work_id":"07917e74-885f-4da2-a8c6-ae52c7a7dd9d","year":2021},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.024346Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:4597a32cde79c440d8ae2a1d6a9b4beafe515c732958560ac1086d3ca92992eb","observation_id":"ca293a36-ff56-41e0-bb22-1ebf757d3c72","resolution":{"observed_at":"2026-08-07T14:39:17.685594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.367526Z","title":"Emotional listener portrait: Neural lis- tener head generation with emotion","venue":null,"work_id":"e2a0e42e-b6a5-4431-a86f-fb4611b43c7a","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.164248Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:7bb25b6ff018e07e49aef83ea5b709d72d3ae02429972270c758c37ae47e822a","observation_id":"744d021a-c70d-45b0-8101-8011d94f188f","resolution":{"observed_at":"2026-08-07T14:39:17.459200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:17.116409Z","title":"React2023: The first multiple appropriate facial reaction generation chal- lenge","venue":null,"work_id":"26e0c40c-ebd7-4847-8c5d-89abb53bfea3","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.336635Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:960dc071d53e384d62366e78732664f5a004a0a28c3ffc66f5310efb9099d669","observation_id":"422e804e-b1db-41f4-84f9-84e6df6d5335","resolution":{"observed_at":"2026-08-07T14:39:17.268369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-13T21:53:08.555281Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-08-07T14:39:11.450440Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.450440Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:6161f9c5b2a919d836a941684118f50511813d86b8062740bff2bf898be330a0","observation_id":"6cd5d85d-b83a-4509-8cbc-15c47c3a9567","resolution":{"observed_at":"2026-08-07T14:39:11.450440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.925911Z","title":"Laughtalk: Expressive 3d talking head generation with laughter","venue":null,"work_id":"30bce023-6477-4756-8c9d-6011fce5a9ed","year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.606460Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:765ee89772d6b127e423574ca60fed5657a62abc15880e0281b136651475b66d","observation_id":"8c9f52ef-28d9-45f5-9f83-a0ceb0336a92","resolution":{"observed_at":"2026-08-07T14:39:17.031219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.763979Z","title":"Imitator: Personalized speech-driven 3d facial animation","venue":null,"work_id":"2654f7fe-2495-43df-b513-68aad43a7014","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.704385Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:12aa05bd974017595586b6409c36cdb4b3322cb8ae272b4bfb01e87e75e8132d","observation_id":"03f9e27e-2e52-44d7-b817-9560636c1dfe","resolution":{"observed_at":"2026-08-07T14:39:16.845207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09069","last_updated":"2024-07-17T21:53:41Z","snapshot_observed_at":"2026-08-16T14:09:58.805440Z","submitted_at":"2024-03-14T03:21:33Z","title":"Dyadic Interaction Modeling for Social Behavior Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09069","snapshot_observed_at":"2026-08-07T14:39:11.891223Z","title":"Dyadic interaction modeling for social behavior generation.arXiv preprint arXiv:2403.09069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:11.891223Z"},"links":{"cited_paper":"/paper/2403.09069","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b62211a0256bad44d33856f1e3ade237f42aa4d1b8940b32be289b8217740fa0","observation_id":"c45ad741-e225-4f69-90c9-ea95eaa12a2b","resolution":{"observed_at":"2026-08-07T14:39:11.891223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.522702Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":"4f3a74bd-ff78-4662-a03d-018ca71ed4b6","year":2017},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.029845Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:d05c9ee0972fc069c98f1471e8a19fb245b3ee959758e7629c175ccd9c3b8b4a","observation_id":"5cc2cdf7-7a8a-4c89-a0db-6bd81d8d7aae","resolution":{"observed_at":"2026-08-07T14:39:16.620401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09740","last_updated":"2024-09-17T08:00:50Z","snapshot_observed_at":"2026-08-17T23:33:04.271916Z","submitted_at":"2024-09-15T14:10:31Z","title":"VGG-Tex: A Vivid Geometry-Guided Facial Texture Estimation Model for High Fidelity Monocular 3D Face Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09740","snapshot_observed_at":"2026-08-07T14:39:12.156492Z","title":"Vgg-tex: A vivid geometry-guided facial texture estimation model for high fidelity monocular 3d face reconstruction.arXiv preprint arXiv:2409.09740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.156492Z"},"links":{"cited_paper":"/paper/2409.09740","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:3351cfd3dc59bd9caf2b6cba627db218b6f35424bfce24f9f413e479b1ed3ac0","observation_id":"91285c40-8cba-4b34-8140-50857e423498","resolution":{"observed_at":"2026-08-07T14:39:12.156492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-07T14:39:12.290540Z","title":"Autogen: Enabling next-gen llm ap- plications via multi-agent conversation framework.arXiv preprint arXiv:2308.08155, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.290540Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:c66e246a7a2f4d2a976352ea52bfce875a2c2fa90504ab4a14604d702cf6c756","observation_id":"f0df8f66-6cb5-4eb3-8895-e9c2949a2219","resolution":{"observed_at":"2026-08-07T14:39:12.290540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.370397Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":"661c5c62-a006-4d28-9c09-4441f76b2697","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.406648Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:9b76045482c1a49b12a16340dbeda55e6280be542770f9c152694360ee9c4729","observation_id":"563c1a0b-a1bb-428e-946d-541f3395724e","resolution":{"observed_at":"2026-08-07T14:39:16.436078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:16.183227Z","title":"Nofa: Nerf-based one-shot facial avatar recon- struction","venue":null,"work_id":"b519832e-5a57-4417-8abb-d090aa722b92","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.535992Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:b02e6b3489487ef149f347b05cfb0df7fa5ef628cbe2cc3547280709f8285c44","observation_id":"c93a91c0-ced5-4d0f-b9c0-7e464d4e2201","resolution":{"observed_at":"2026-08-07T14:39:16.283323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.968833Z","title":"Human-computer interaction system: A survey of talking-head generation.Electronics, 12(1):218, 2023","venue":null,"work_id":"e1406497-d6e7-4dc2-b0c4-e2cfd927c164","year":2023},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.656839Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:feb45d93c2da0e328c0f9498716cfae3707116208cafc54a6bbf650a4a3adecc","observation_id":"2e539a54-fe2a-433d-aafa-2864bcae76bc","resolution":{"observed_at":"2026-08-07T14:39:16.057653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.723332Z","title":"Responsive listening head generation: a benchmark dataset and baseline","venue":null,"work_id":"4bada142-552d-400e-9ce9-4801fe996a57","year":2022},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.761642Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:43e328fb872ec1e086781e36e0d5d7ab7bda3ad1e76b275c74aa788de218a3b9","observation_id":"bfb7cbfd-d1cd-4672-8cd5-d9f5676e63dd","resolution":{"observed_at":"2026-08-07T14:39:15.836708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09357","last_updated":"2024-08-18T04:42:43Z","snapshot_observed_at":"2026-08-17T02:10:31.738901Z","submitted_at":"2024-08-18T04:42:43Z","title":"Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09357","snapshot_observed_at":"2026-08-07T14:39:12.873023Z","title":"Meta-learning empowered meta-face: Personalized speaking style adap- tation for audio-driven 3d talking face animation.arXiv preprint arXiv:2408.09357, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.873023Z"},"links":{"cited_paper":"/paper/2408.09357","citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:1849785ab26077c9a78a5d6d23b08b4484b0e32f6880903badfb154b487d9639","observation_id":"e6428501-3063-4c70-be21-f5a5aa78b528","resolution":{"observed_at":"2026-08-07T14:39:12.873023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.551369Z","title":"Visemenet: Audio- driven animator-centric speech animation.ACM Transac- tions on Graphics (TOG), 37(4):1–10, 2018","venue":null,"work_id":"f689cef8-17dc-4b2b-a92d-19cc36913db7","year":2018},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:12.982202Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:e3efa7863383bac3041da1d8b43439ae3f2df0c0217046c1ce40333aa442aa6e","observation_id":"22127174-c4f6-4c6c-8004-ca10ebe3e35d","resolution":{"observed_at":"2026-08-07T14:39:15.631924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.340394Z","title":"Network Architecture In this section, we provide comprehensive implementation details of our DualTalk framework","venue":null,"work_id":"16e671ba-03b3-4405-a5b9-fedd555de3bb","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.092431Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:aab4ec474f2a9afaf2345bb265dacdb1ab8d627ed9b2eba20cd67b96b765edde","observation_id":"e4c46f00-d496-4697-8ba5-f8be58c03463","resolution":{"observed_at":"2026-08-07T14:39:15.443570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.833184Z","title":"Here, we provide detailed in- formation about our data collection, processing procedures, and dataset statistics","venue":null,"work_id":"20436344-4846-4556-9104-1b61dfd30922","year":1920},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.359279Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:44d06a54dafccf51f5c574d3227418b6c5d1e524852f42d87e3a36abae5f1a71","observation_id":"9660e38e-2e40-4514-b2d1-b2349330c556","resolution":{"observed_at":"2026-08-07T14:39:14.955563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.628349Z","title":null,"venue":null,"work_id":"090801a7-83fa-442b-ae40-c688d96f3212","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.474746Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:53856dc50fae054d8454f4af22f71390d23a64478b4505fea12471c33ffc07b4","observation_id":"0b79ff21-5b4d-459d-8fac-6cb437bf2369","resolution":{"observed_at":"2026-08-07T14:39:14.715905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.478777Z","title":null,"venue":null,"work_id":"01441661-d0b3-44fb-9896-327168823127","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.629376Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:c127a8ae0c221328110066f3dc05a1a32f8b26863f7c448f448b2207d756756d","observation_id":"0fa3e84a-56c3-4942-a4a8-81a4a20ccb57","resolution":{"observed_at":"2026-08-07T14:39:14.567364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:14.234504Z","title":"While DualTalk ex- cels in creating synchronized and natural two-speaker con- versations, it cannot yet handle multi-party interactions, which are common in real-world applications","venue":null,"work_id":"e374c0b7-a68a-41dd-89a5-7a48272a7c2f","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.746751Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:219117930d952bf7fd8c55276df196a3f0fbc94dcd5f0cf5b30e122348f8c2f4","observation_id":"0bef61ec-2aa8-4f8d-9050-f704ba02b849","resolution":{"observed_at":"2026-08-07T14:39:14.318967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:15.048746Z","title":"The decoder follows a similar structure but includes additional cross- attention layers to integrate information from both speakers","venue":null,"work_id":"757be4c1-e20d-4846-bb9d-5bcd955cc2a4","year":null},"citing_paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:13.227145Z"},"links":{"citing_paper":"/paper/2505.18096"},"observation_digest":"sha256:32a443a0b07a1ad57d2119befe702164bc6b86d8e31634c03ecb2b377e562693","observation_id":"483660ca-40fb-420d-be30-2d4a6a2692a7","resolution":{"observed_at":"2026-08-07T14:39:15.192741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18096","last_updated":"2025-05-26T15:59:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:33:44.277928Z","submitted_at":"2025-05-23T16:49:05Z","title":"DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2505.18096."}