{"as_of":"2026-08-20T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d48fa93c714e2084e633faf574d75dab4a798fb26957aad66e3dc0504891bf9","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:47:09.073686Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13209/citation-record","integrity":"/paper/2411.13209/integrity","json":"/paper/2411.13209/citation-record.json","paper":"/paper/2411.13209"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.128459Z","title":"Simulation-based learning in higher education: A meta-analysis","venue":null,"work_id":"b3e42463-5e67-470e-ace0-ea8c8714da97","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.809431Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:d911c9ae30c50387b4155355ece600cc88411299a471c14202bdafeea83e330e","observation_id":"f79ae570-cab8-4f83-ab06-75077cbb4ac3","resolution":{"observed_at":"2026-08-12T16:47:10.137518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.109196Z","title":"Psychological foundations of emerging technologies for teaching and learning in higher education","venue":null,"work_id":"5019388f-ab87-4d1d-9437-40444ba3b656","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.815259Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:bb4293b07def456014c3a4ada6c67ab04bfcc69b68aedbd6cf776f5118e27c24","observation_id":"9dd10fdb-49bc-4d6e-8a30-eba6a04a0831","resolution":{"observed_at":"2026-08-12T16:47:10.116225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.092402Z","title":null,"venue":null,"work_id":"aca5488b-d229-4dfa-b76a-4c682cec32ee","year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.821437Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f157017c641dfe54e09dcb624fc2bb6a276ed4f8f1648c0c2f8887b1e2ba3cba","observation_id":"f15c7172-b18b-41a4-8d1f-96d407ea625f","resolution":{"observed_at":"2026-08-12T16:47:10.097669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.073010Z","title":"Designing effective training programs for investigative interviewers of children","venue":null,"work_id":"fbe79ea2-a18f-42bb-bd4f-199995f5d4a6","year":2008},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.826723Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:01c674327effbd782b4a68ecd3b0b69dbe5207599a1a13e12b40108b0e1074ce","observation_id":"b8c58379-42cb-4f6a-b13a-ba795041be66","resolution":{"observed_at":"2026-08-12T16:47:10.079749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.051107Z","title":null,"venue":null,"work_id":"0dd95417-5788-4962-9caa-33b942d4a7fc","year":2007},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.831853Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7b89be3bfef9285247a80a1058bf37049583288795219021ac46cad1b1bc6177","observation_id":"7fb1a43d-1ef9-482a-9fa9-76a5447ead54","resolution":{"observed_at":"2026-08-12T16:47:10.058801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.027361Z","title":"Interviewing children","venue":null,"work_id":"daf0dd3b-fd5a-4419-95c3-0bdbc9b2632e","year":2014},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.837457Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c392ff8d586669ae921e20959ae8c2aa5943b3bf8471d2547a016861289cb988","observation_id":"06bbf19c-0514-4af6-aea9-aa1f47d53b63","resolution":{"observed_at":"2026-08-12T16:47:10.037742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.008019Z","title":"Tell me what happened: Questioning children about abuse","venue":null,"work_id":"b3fadbe5-867a-40d0-a823-d555602ae517","year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.845623Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:2cb515282ec648574021ae1e6a123d79623a4b26391f7e628b89bb975db7b3e5","observation_id":"d63462fa-9032-4607-a731-0f2b2fd92dff","resolution":{"observed_at":"2026-08-12T16:47:10.013244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.991370Z","title":"An overview of mock interviews as a training tool for interviewers of children","venue":null,"work_id":"2c4e5249-a892-4b1d-99c2-16e99dee4944","year":2022},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.854431Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:6fa85157ed97327996b82feebbcac530411034e12f838a7f3566fbe02e87410c","observation_id":"8de70706-2588-468e-9620-a250123246a0","resolution":{"observed_at":"2026-08-12T16:47:09.996698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.973971Z","title":"Towards an ai-driven talking avatar in virtual reality for investigative interviews of children","venue":null,"work_id":"3408b22c-aca3-4800-834a-21fca5bbe9aa","year":2022},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.860126Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:ffea7bb08e12d8faa15747c2b550193fd5b7faf33bb9cc2cffd1139741cba4f6","observation_id":"ef11a872-8f79-49ef-a3da-61ca9fdfec2f","resolution":{"observed_at":"2026-08-12T16:47:09.979634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.957580Z","title":null,"venue":null,"work_id":"0efd2f06-cea5-4b62-9ea4-7e2fe481b9e4","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.866481Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:6ba1113c25608345ed89dfadd1af515b095d0553b344f1214b78648a9e73a06f","observation_id":"e6547aa4-dfc5-4c06-ad48-0e81540c28da","resolution":{"observed_at":"2026-08-12T16:47:09.962601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.871543Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.871543Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:666f9558366cec0276be5200266916f71155ca169e7580854717bbd23b76af8c","observation_id":"459553b4-ab63-4bf2-8d48-a903b32abb04","resolution":{"observed_at":"2026-08-12T16:47:08.871543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.876364Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.876364Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f1f823c958248e8ccc2c782daac72392d9d787058f9eea06a887068f58f7eb4c","observation_id":"49f82dc4-9230-4af4-b7c9-93105dbfb566","resolution":{"observed_at":"2026-08-12T16:47:08.876364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.917682Z","title":"Whisper afe for talking heads generation","venue":null,"work_id":"e602135b-e354-45bc-8519-86130d4769be","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.881311Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:12e8c875df0f48523abce751d55fabde8bc58d8d33767973552d2e5e24933b03","observation_id":"9afcc583-79bf-4bae-8a57-dd3d1b84e27f","resolution":{"observed_at":"2026-08-12T16:47:09.923125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.900519Z","title":"Technological acceptance of an avatar based interview training application: The development and technological acceptance study of the avbit application., 2021","venue":null,"work_id":"7a98edbb-6ba2-4d65-9035-7820fe74f6fc","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.886036Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:1866f13d2df0bd576a8645f66bf116971811df6e8f6b6785edac6d446be74157","observation_id":"1e4731ba-445f-4ebe-85c7-2beadc0f5829","resolution":{"observed_at":"2026-08-12T16:47:09.906522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.883796Z","title":"A field assessment of child abuse investigators’ engagement with a child-avatar to develop interviewing skills.Child Abuse & Neglect, 143:106324, 2023","venue":null,"work_id":"801b5838-3410-47f9-9456-19c54fba16a0","year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.890840Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:9484bce3325c98e9884bec4d7d3f5b35d4117a0b560bd2cfa2fe6ce3d7bb6a0c","observation_id":"254f0f89-aefd-464a-8222-e8ef696b67b7","resolution":{"observed_at":"2026-08-12T16:47:09.889013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.860596Z","title":"Evaluation of a comprehensive interactive training system for investigative interviewers of children","venue":null,"work_id":"ab33c7fd-62ff-4f7c-ad9e-5be8f38ee72a","year":2015},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.895764Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:5c1586a0c1fd7c08bdffcaaa87dca58daf2d0afe361fff587e1453419e8f10e3","observation_id":"685af020-1d76-4329-ba5f-1a0148af9b01","resolution":{"observed_at":"2026-08-12T16:47:09.871318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.836520Z","title":"Training in investigative interviews of children: Serious gaming paired with feedback improves interview quality","venue":null,"work_id":"36f6fa1f-5082-4166-8c4e-06b8d1735b09","year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.900547Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:11604de1fe1acf25728ce5642f124a77a9a8ac0a4ca1d67c91bb179164dda175","observation_id":"702d9421-bf07-49a6-9884-87ad94a959c6","resolution":{"observed_at":"2026-08-12T16:47:09.842122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.817538Z","title":"How to prepare for conversations with children about suspicions of sexual abuse? evaluation of an interactive virtual reality training for student teachers","venue":null,"work_id":"7fa61528-7b9f-45b6-8bdb-0c7dd6637c96","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.905396Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:93d3a00c0faa099fa9d872fa1f7613519ab1d9aa9841372dddde253791a40430","observation_id":"61322ef2-4dae-47ec-8f1a-1dda5755b770","resolution":{"observed_at":"2026-08-12T16:47:09.823380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.798329Z","title":"A theoretical and empirical analysis of 2d and 3d virtual environments in training for child interview skills","venue":null,"work_id":"a56c0c29-2cc3-4d8d-a62e-01f16efb962a","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.910586Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:ea3d25f641a0e0d68c6c1eb5efd6339621cad215f5cd7b7660b297e94247a158","observation_id":"6d6295ca-6422-4315-b270-9bbbae55ebbd","resolution":{"observed_at":"2026-08-12T16:47:09.805367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.777043Z","title":"Live speech portraits: real-time photorealistic talking-head animation","venue":null,"work_id":"bc663734-c03e-4a4a-ba31-f274bf738d6d","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.915545Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7f49fdda608953fdf5a2c4560deb90fcbf1394cddd0cd5ee0c11aaabcd0e469b","observation_id":"c2fae4ba-10c1-41fd-8864-375aade7d8dc","resolution":{"observed_at":"2026-08-12T16:47:09.784817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.758317Z","title":"Generative pre-training for speech with autoregressive predictive coding","venue":null,"work_id":"cafbc5b2-10c2-405f-b31f-e27593250910","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.921810Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:eccf5e58829d1845a34024c8df9f9a29c312a5efdffae74b44360e301729e141","observation_id":"20e87e22-84b4-49f7-9d7e-c043b3586c9c","resolution":{"observed_at":"2026-08-12T16:47:09.764253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18284","last_updated":"2024-08-08T12:18:30Z","snapshot_observed_at":"2026-08-16T13:39:27.850732Z","submitted_at":"2024-06-26T12:09:59Z","title":"RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18284","snapshot_observed_at":"2026-08-12T16:47:08.927249Z","title":"Realtalk: Real-time and realistic audio-driven face generation with 3d facial prior-guided identity alignment network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.927249Z"},"links":{"cited_paper":"/paper/2406.18284","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:56fb131717d5a5583f21d1d7d3e14558127cba42646c66ec93f4ef1a29a03575","observation_id":"968615b6-4508-44d6-aeb5-d66cba41690e","resolution":{"observed_at":"2026-08-12T16:47:08.927249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.934320Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.934320Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:9c2162e277a90f5603648464c4fdd8febe557f3efba0b19c1a405615bce4a391","observation_id":"eccb74c8-ffda-4f2a-b55a-d225e16f4298","resolution":{"observed_at":"2026-08-12T16:47:08.934320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19040","last_updated":"2024-04-29T18:28:36Z","snapshot_observed_at":"2026-08-16T13:56:50.845075Z","submitted_at":"2024-04-29T18:28:36Z","title":"GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19040","snapshot_observed_at":"2026-08-12T16:47:08.940014Z","title":"Gstalker: Real-time audio-driven talking face generation via deformable gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.940014Z"},"links":{"cited_paper":"/paper/2404.19040","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:232639dedfc9c18e230ffba21ca136cc1c2eadb3efec1b029ee25a774d475fe1","observation_id":"73e3db43-c7ed-4143-8bb4-e062bdbeafc8","resolution":{"observed_at":"2026-08-12T16:47:08.940014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.726910Z","title":"Gaussiantalker: Real-time talking head synthesis with 3d gaussian splatting","venue":null,"work_id":"6e2a39ee-532c-4c1a-8b22-bab181dfa802","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.945932Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:4f11454a79d6ba23123a74c40337abce19fe2fc99c40c88387855f0bb7e2414b","observation_id":"b3479857-ac82-4187-914f-25a0c087d6b8","resolution":{"observed_at":"2026-08-12T16:47:09.733110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-19T11:13:23.284476Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-12T16:47:08.951700Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.951700Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:23e8c1dbc2c50b60ad568be1fd3f47b89cdfed16d9e9215a6477b5de1da0d554","observation_id":"5d2d5425-b974-4633-b021-4a6d0777df82","resolution":{"observed_at":"2026-08-12T16:47:08.951700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.707379Z","title":"Ad-nerf: Audio driven neural radiance fields for talking head synthesis","venue":null,"work_id":"3857268c-310a-4f16-8c9c-294a479566a4","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.957073Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:4f4efc5373d7cffd8acaf279d9ea3097593f442e7696f16fed2ca512915546a9","observation_id":"340d058e-1a90-42b8-a0eb-a1ba860a06db","resolution":{"observed_at":"2026-08-12T16:47:09.713679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.687698Z","title":"Efficient region-aware neural radiance fields for high-fidelity talking portrait synthesis","venue":null,"work_id":"01d3455f-95bf-4b9d-9a91-c252c4fe88d5","year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.962409Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:feae37a5ede13193e6ede954495f28a1b543dcf874ff2b5b2c9e7f3995808471","observation_id":"6a0bc73a-2840-4c52-a266-a925773d2d0e","resolution":{"observed_at":"2026-08-12T16:47:09.693229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00787","last_updated":"2023-05-01T12:24:09Z","snapshot_observed_at":"2026-08-17T16:40:43.667059Z","submitted_at":"2023-05-01T12:24:09Z","title":"GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00787","snapshot_observed_at":"2026-08-12T16:47:08.967948Z","title":"Geneface++: Generalized and stable real-time audio-driven 3d talking face generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.967948Z"},"links":{"cited_paper":"/paper/2305.00787","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:42874dc36db7c33bb52652011a3b0d54aa100ea28c08d12f6c57099899c368fa","observation_id":"64c5e362-c91c-447e-b9b9-abd19f84ba16","resolution":{"observed_at":"2026-08-12T16:47:08.967948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05572","last_updated":"2023-12-09T13:21:01Z","snapshot_observed_at":"2026-08-19T01:33:17.313323Z","submitted_at":"2023-12-09T13:21:01Z","title":"R2-Talker: Realistic Real-Time Talking Head Synthesis with Hash Grid Landmarks Encoding and Progressive Multilayer Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05572","snapshot_observed_at":"2026-08-12T16:47:08.974918Z","title":"R2-talker: Realistic real-time talking head synthesis with hash grid landmarks encoding and progressive multilayer conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.974918Z"},"links":{"cited_paper":"/paper/2312.05572","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:443fa52ccb46df2207afe6ebe47fc08a45147bd6309786bfb932b91db3af4ba0","observation_id":"d4842ba4-5216-4a80-80a5-f2b6cf9ca685","resolution":{"observed_at":"2026-08-12T16:47:08.974918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.980477Z","title":"Deep speech 2: End-to-end speech recognition in english and mandarin","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.980477Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:14daec2895f11d4fe95dcfcbce453c1031303ed5970a44c144eed45ab0f36c38","observation_id":"332784ed-7baa-4373-bca8-fab16268a54e","resolution":{"observed_at":"2026-08-12T16:47:08.980477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.657770Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"4baf6f64-94e5-4afa-b8ff-74a1be894492","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.985782Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:633e1081c04b7729e0d82696240f7ead621f7c672e2b4987b906ce122a7a7662","observation_id":"fb0395bf-b997-4d87-82f8-3aae258faa57","resolution":{"observed_at":"2026-08-12T16:47:09.663290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.640230Z","title":"Hubert: How much can a bad teacher benefit asr pre-training? In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages 6533–6537","venue":null,"work_id":"5c2a8d64-f6c7-4545-a27e-f031d430dce9","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.991193Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:4d46bfba5a03b5b3bbee87dc764346a9a3edbab7391dd5daa7445a0f38fd9c0e","observation_id":"cf61b4c4-1e46-434f-b3a0-86b91a4766d9","resolution":{"observed_at":"2026-08-12T16:47:09.645909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.997783Z","title":"Bidirectional recurrent neural networks","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.997783Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7b01d138dd8741b4407120dfdadfb7b2898f9c5982198abb4c90ba219de67117","observation_id":"8f0216d4-df7f-4a21-a22a-ae3c0b888dcc","resolution":{"observed_at":"2026-08-12T16:47:08.997783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-12T16:47:09.003205Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.003205Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:57abb6932409b2f0dd6f96e8d8ff414ff7bc0383ffd31f552a6fc665e3fa8b98","observation_id":"89851c0b-c735-49f0-8656-174646668c90","resolution":{"observed_at":"2026-08-12T16:47:09.003205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-19T02:01:30.415867Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-12T16:47:09.012586Z","title":"vq-wav2vec: Self-supervised learning of discrete speech representations","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.012586Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:02d27b73d9bf7e8ca5ba73067c0552c88404e7406d25d230c8a5b719d895ce8b","observation_id":"058cc7c1-7830-4a7c-9327-49db50e7c999","resolution":{"observed_at":"2026-08-12T16:47:09.012586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.018545Z","title":"Product quantization for nearest neighbor search","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.018545Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7a9f3526b6a8e429a3710ff9a4e5c39422485b778ab5547609ac9c1dd406fb65","observation_id":"0dcb4ce5-457d-45d7-b455-1c25e382afc7","resolution":{"observed_at":"2026-08-12T16:47:09.018545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.026473Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.026473Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:b202940f4e867029dc310df323eefcce4e5c9f9cadbe74eef23ba947a2f30142","observation_id":"bb09211e-51af-44f9-bdc5-38409a41b11b","resolution":{"observed_at":"2026-08-12T16:47:09.026473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.581885Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":"c466e4aa-ea50-49a1-836a-d430ad51ad54","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.033426Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c820c55eb914d9afe542f180138072c5898589a8e1e990cca0378521b7d7d86b","observation_id":"07afb9dd-47a8-4890-a6f3-30820aa4e43a","resolution":{"observed_at":"2026-08-12T16:47:09.588803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.554195Z","title":"Spanbert: Improving pre-training by representing and predicting spans","venue":null,"work_id":"60b1de5e-939d-4931-99a5-62dabb0b7639","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.038620Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:1180df711277f79d7777343420f87c12f6288839735bc8204f65f0e27efbf760","observation_id":"f6ef059b-e217-4d56-a14b-a04a74f80190","resolution":{"observed_at":"2026-08-12T16:47:09.560601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.521255Z","title":"Aws polly","venue":null,"work_id":"8b89ed63-10b6-4268-8140-2c43e8703e05","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.043469Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:2cb20333919c77178f6aa9231225570978f77d57b7d690fae896dd3e79d724d0","observation_id":"3a3b8606-b8d1-438e-92b2-cead2e4d942e","resolution":{"observed_at":"2026-08-12T16:47:09.527753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.048662Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.048662Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:d2d79d68949200e03710f0486662643c3f0c9f754f64a0291b515d719d91b2c7","observation_id":"25de3783-3ddb-49b7-823b-b5f12ffaaf4a","resolution":{"observed_at":"2026-08-12T16:47:09.048662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.341695Z","title":"Lip movements generation at a glance","venue":null,"work_id":"83b87a4c-9739-447d-a732-bbaec9345a21","year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.053891Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:5874c403a000d4d1abb47d5b06f4af6be57541ce4522c2043b988f641adc5a6f","observation_id":"35fb33ed-2fd1-432c-a89f-493632187426","resolution":{"observed_at":"2026-08-12T16:47:09.347158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.058524Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.058524Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:18d0bdaa9fbe5b1c6b3b138985f15efdb708f166e2ae799dfd8c1d69e350701e","observation_id":"fc2861b9-2d0f-4d83-aeea-a5060dc8bc2d","resolution":{"observed_at":"2026-08-12T16:47:09.058524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.306226Z","title":"Openface: an open source facial behavior analysis toolkit","venue":null,"work_id":"317a3f81-239c-48b1-97d8-6c80578b7ef1","year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.063648Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7090dcd2b22930a943e796b212c6b4fce0aa68b1b10044f2edd1473377e61b5e","observation_id":"feaa8353-5d57-414f-a279-d85d128132f7","resolution":{"observed_at":"2026-08-12T16:47:09.313668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.068356Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.068356Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:a7b4ec4a5541964f4132f5eb2a79f3d3b433c61fbd5b7045023c0790a4018b90","observation_id":"41c8fe3c-3a32-4f46-a06b-c9de70833c37","resolution":{"observed_at":"2026-08-12T16:47:09.068356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.263492Z","title":"The uncanny valley [from the field]","venue":null,"work_id":"694b68ea-babc-4dbb-82ef-223458e53b67","year":2012},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.073686Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:d7a7116698372f83ba23c2ced6f891d95e087af24a5c54768acf680912f1ac17","observation_id":"7fb85829-6862-4cb8-9218-679ab8d50885","resolution":{"observed_at":"2026-08-12T16:47:09.272448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T15:02:02.077868Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2411.13209."}