{"as_of":"2026-08-13T12:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a32d21936362ee753493c1141195a8900ea1af2b9dd029c188f18f712c18c944","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:41:36.351183Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03181/citation-record","integrity":"/paper/2501.03181/integrity","json":"/paper/2501.03181/citation-record.json","paper":"/paper/2501.03181"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:37.082423Z","title":null,"venue":null,"work_id":"991a5128-59d4-4d56-9e5c-36b90f020ec1","year":2008},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.132625Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:218687e4194a4d327c5f174abc51c6baf876e8fc8c8f5a28757a0e98212ac6b2","observation_id":"0cd0b04b-9cb8-4660-a2ff-e5416f9b7ad3","resolution":{"observed_at":"2026-08-10T22:41:37.087147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:37.067681Z","title":"D.; Junior, A","venue":null,"work_id":"b7218222-fb9b-476b-8b58-4ebbb50e65b7","year":2022},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.138383Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:ff1382d5edd2fe0187ddfd42ce9c0462226cf738842bd1225fc7c234b87f0be6","observation_id":"4c1c9f97-fd41-4ca4-afa3-388462644bff","resolution":{"observed_at":"2026-08-10T22:41:37.072363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:37.052858Z","title":null,"venue":null,"work_id":"344f2e63-a2a5-4b43-afee-c69f00b7e17d","year":2020},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.143911Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:0a3ffd7d9765ada191fe48a15d07f326fcd5872a65dac347dabb468099cdd23f","observation_id":"e8f132ba-2ff2-4845-8880-75f30ed24922","resolution":{"observed_at":"2026-08-10T22:41:37.057806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:37.038445Z","title":null,"venue":null,"work_id":"ddf3f61c-a7ef-4438-8469-81b66f97da02","year":2010},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.148931Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:44b6c7c66998f6739a73a6e81b0fc8174df2f6a248652525bbe3bcea691eccdd","observation_id":"bc795638-fa69-4bdf-84c3-7e82450275dc","resolution":{"observed_at":"2026-08-10T22:41:37.042970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:37.023166Z","title":null,"venue":null,"work_id":"1798c868-757c-4b08-a046-fc251a915f21","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.153441Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:459a8325f9603f3797576e81994d1f5b278af6c9e21b3e390722b3f5649ac103","observation_id":"370281cf-ac18-4132-aa8d-03d4df1aba5a","resolution":{"observed_at":"2026-08-10T22:41:37.028124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:37.007236Z","title":null,"venue":null,"work_id":"afefea18-3efc-44fa-87b0-9a2b95104bc9","year":2016},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.157815Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:7eecd88348720ef4a766451932bce2a2f99cf798974b1f643c39c76c0e5d4384","observation_id":"d45c52d2-4315-4401-9aeb-9f65a73f683e","resolution":{"observed_at":"2026-08-10T22:41:37.012214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.992573Z","title":null,"venue":null,"work_id":"c0019a69-962a-42aa-94c9-fadaf3f09f53","year":2024},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.163087Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:bb8b5a2369029ad3708541ac3cbbf80f172370955e3cc0ec74c8e5766d9657f2","observation_id":"e569554e-38c3-4e38-827f-78b80cae1557","resolution":{"observed_at":"2026-08-10T22:41:36.996987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.977447Z","title":null,"venue":null,"work_id":"b29c6a2f-515d-497d-9692-cc3cb3033158","year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.167444Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:89412388306583b71ca6383353185d1bee32b7a06bb8819ed34cf50f766e8c51","observation_id":"7a9b4400-df5a-4ef6-93c1-7c2aa3b52999","resolution":{"observed_at":"2026-08-10T22:41:36.982446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.960989Z","title":"J.; Laver, J.; and Gibbon, F","venue":null,"work_id":"e59ad7ef-6f81-4600-a212-bd5fc1ee875b","year":2012},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.171829Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:9ed7098dd5cd8d3db4b8477c694bfc4a7da8d4170219f659de3a18fcf0913e57","observation_id":"213bf79e-889b-48ba-8ad5-1488e3bb7316","resolution":{"observed_at":"2026-08-10T22:41:36.965738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.945932Z","title":null,"venue":null,"work_id":"3560d611-7a45-410c-8779-8cbf522d2af6","year":2022},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.176993Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:bbad8b30e405e66bc5e53e06de4d269d01bd8e68e1ae655881fe78a9c3de8759","observation_id":"a7d28ccc-4a4a-4d16-99fa-691fa88b482d","resolution":{"observed_at":"2026-08-10T22:41:36.950518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.929894Z","title":null,"venue":null,"work_id":"95df9cc1-4e0f-45fc-a151-92c15af394c1","year":2024},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.181437Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:7c9d95bed9dbf265ba01be84b2f1103709319472ae0b730554b45294162d6118","observation_id":"6a420c99-2087-4b50-9afe-01b93b56e2f1","resolution":{"observed_at":"2026-08-10T22:41:36.935990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-08-13T11:23:37.547715Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-10T22:41:36.186653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.186653Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:de1961d7cfd557bd75d6e65f6420577669cc56cc81a0fc7030fbb0ddbd0b400f","observation_id":"2e561cb2-75f7-4f63-8ced-106c91d58529","resolution":{"observed_at":"2026-08-10T22:41:36.186653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16430","last_updated":"2023-07-31T06:36:44Z","snapshot_observed_at":"2026-08-13T10:44:26.644492Z","submitted_at":"2023-07-31T06:36:44Z","title":"VITS2: Improving Quality and Efficiency of Single-Stage Text-to-Speech with Adversarial Learning and Architecture Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16430","snapshot_observed_at":"2026-08-10T22:41:36.192653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.192653Z"},"links":{"cited_paper":"/paper/2307.16430","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:ba4606238025575dd713eff522dcc5eb7f40178ddc8cbf8f82c4588607f1c94c","observation_id":"8ad4b229-10ea-46f5-92ff-4cefb56dd5e2","resolution":{"observed_at":"2026-08-10T22:41:36.192653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.915645Z","title":null,"venue":null,"work_id":"df8632c7-def0-4a94-906f-fd5bb26b7908","year":1993},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.197715Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:6feded834ea099416ecf8abfefbbebddd0b9f1d2d40dee1280bcba925d9beb09","observation_id":"f9ecc135-25ee-4f94-8f73-49566124acec","resolution":{"observed_at":"2026-08-10T22:41:36.920130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.901384Z","title":"S.; et al","venue":null,"work_id":"f036f041-5ceb-472d-bb9d-066fa7479264","year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.201693Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:0d1e2a8b125a54847760dd8f9e00f169d35aed2e930d9414753f66d5fbd31a82","observation_id":"d0140481-2f20-4b52-9968-c7e144247b2b","resolution":{"observed_at":"2026-08-10T22:41:36.905855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.886924Z","title":null,"venue":null,"work_id":"ec160f6d-c784-4e61-9ee5-bbab4404fa73","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.205911Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:91d4ee440b607c9c451f187aed25c05af320d1d4a9a6186e02186d7cb6d7ef00","observation_id":"1b1eccc1-a6be-45da-9578-c46b99003b11","resolution":{"observed_at":"2026-08-10T22:41:36.891333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.872785Z","title":null,"venue":null,"work_id":"52b6aaee-9583-4956-9982-7306725af1b2","year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.210724Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:15d8ccba7f8d3a7b27da9170d7d08c9acd74e461e4a19e975e1cb4a59db5b63e","observation_id":"6443626d-8eb3-4468-a1fe-b7a79294c5a5","resolution":{"observed_at":"2026-08-10T22:41:36.877211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.858547Z","title":null,"venue":null,"work_id":"6170f327-40fc-4094-b066-fa677bb9cbe0","year":2019},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.216138Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:61d362dd9acf95364368927485f72a19c391cabf270fcf4e4cb6ffde6784b4a8","observation_id":"6490c36d-b69b-4771-981e-fa10fb891513","resolution":{"observed_at":"2026-08-10T22:41:36.862626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.844583Z","title":null,"venue":null,"work_id":"21f4a98a-21e5-4724-84b1-350640de7f0b","year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.220509Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:e716fcb4c66ee1f5fc7e741cf7bc4c6f39e5ba42ed40a550cbecd40c394bd987","observation_id":"e649a9df-0a16-46cb-87fc-44e52961b477","resolution":{"observed_at":"2026-08-10T22:41:36.848562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04461","last_updated":"2023-12-07T17:32:29Z","snapshot_observed_at":"2026-08-13T05:07:48.838356Z","submitted_at":"2023-12-07T17:32:29Z","title":"PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04461","snapshot_observed_at":"2026-08-10T22:41:36.226840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.226840Z"},"links":{"cited_paper":"/paper/2312.04461","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:2015383ee1e7d8d91ac19c5921f4f588722c50c7f2663ae08bcbf654907033df","observation_id":"bca8b896-fcb0-4077-a98a-d51a3a8e00c2","resolution":{"observed_at":"2026-08-10T22:41:36.226840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.830601Z","title":"R.; and Russo, F","venue":null,"work_id":"7f171fbc-2791-4f01-ab70-ba00d848f08f","year":2018},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.231284Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:b8c3df0507a17d783ea2b8d31698a71f5c948fcbd9e8282e18d5626caa12c075","observation_id":"9b4e0f90-4d39-4ac6-a5a7-633f4cf1fbe4","resolution":{"observed_at":"2026-08-10T22:41:36.835037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.815838Z","title":null,"venue":null,"work_id":"be742a3c-ead8-46dd-9e9c-2466a9803b17","year":2022},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.235359Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:e2f3e48aef5609b81beeb7826e28471f0f4130b37075041f26538bc063b14ef3","observation_id":"a7e7f835-91ae-4a6b-991e-62694e2db416","resolution":{"observed_at":"2026-08-10T22:41:36.820369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.800642Z","title":"B.; Yang, E.; and Hwang, S","venue":null,"work_id":"5f8203ee-62d4-4a52-b9b5-9e26cfb87317","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.239468Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:cb9e467c888a367aa15ebb4ed6e1a774faf5e7ab5913f0a1af6436ac8cc330d0","observation_id":"9e01b7ae-2aa8-4ac2-8300-9277a1d020f2","resolution":{"observed_at":"2026-08-10T22:41:36.805787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.785991Z","title":"S.; Morerio, P.; Mahmood, A.; et al","venue":null,"work_id":"7f6516b8-3839-45cb-a6a3-b17cb3de9714","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.245095Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:6383c7fe3a28b61d05601272e10c126c25f3bf340e32445cfc8c16014553c182","observation_id":"e7b37353-40e3-47e5-ae16-97ff7acc4002","resolution":{"observed_at":"2026-08-10T22:41:36.790428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-13T10:37:03.795815Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-10T22:41:36.249771Z","title":"A.; Hsu, W.-N.; d'Avirro, A.; Shi, B.; Gat, I.; Fazel-Zarani, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.249771Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:e156f2c20ec71271660abc8cf3d3792fabae862f212e4083dac1e33760a0be57","observation_id":"859b9f78-d0d5-48ab-a872-84b4d20ea4e9","resolution":{"observed_at":"2026-08-10T22:41:36.249771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.771345Z","title":null,"venue":null,"work_id":"dfa1e901-199c-48d0-90a8-972ab75f94cf","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.254893Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:bf5de8f5e477a40de0c4436744d5c90f497162ab641aceed67e5b36c4167de6c","observation_id":"83d2d1da-cc32-4446-8d57-a3a8c9fcd4e3","resolution":{"observed_at":"2026-08-10T22:41:36.776154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.756560Z","title":null,"venue":null,"work_id":"1fc77ce6-8e6c-44dd-97f3-22a9ed007e3c","year":2018},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.259539Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:23afb87902c63303bd45e3ba6179f64b5d7a723a6e6ad22155626a4dac482cdc","observation_id":"ff7b5364-6e67-41e2-8e14-cf6fd77dfee1","resolution":{"observed_at":"2026-08-10T22:41:36.761405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-10T22:41:36.264122Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.264122Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:db3aa5301f814ff71fef0466a981630661365fd0e654d90e985533f38e9f6006","observation_id":"68c217f8-b477-4d00-a6f6-1b230cea27e9","resolution":{"observed_at":"2026-08-10T22:41:36.264122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.741322Z","title":null,"venue":null,"work_id":"4cff685f-bcc3-4f5b-8321-8d94a30c2fb0","year":2016},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.269217Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:296714addd8ec3bc4add3cf16238ac8601f72ff6d2eaef431a3db02ce7223054","observation_id":"b92f1731-c817-423a-abb2-7130a389c4d2","resolution":{"observed_at":"2026-08-10T22:41:36.746789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.727337Z","title":null,"venue":null,"work_id":"12f6569b-3e4d-4d50-ad51-3e18477e56ac","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.273603Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:78d5575eeacc73daddd1fff58aeb4e9a370e986b74aa1e09c320088232037dec","observation_id":"f07d4c8f-263c-4414-b209-fc9300debf63","resolution":{"observed_at":"2026-08-10T22:41:36.731703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.712668Z","title":null,"venue":null,"work_id":"5f561577-62d7-4c97-97e5-a0ba1f5e59f9","year":2018},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.278152Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:484cbbe9a99ef846343580d289bcd35bf766d04fe75e82db1a03d22f0c255851","observation_id":"34464685-00c5-40bd-b593-65d44ca4a78c","resolution":{"observed_at":"2026-08-10T22:41:36.718006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.697203Z","title":"G.; Alrashoud, M.; et al","venue":null,"work_id":"5f01f1be-dd57-488b-ba33-bf32b83546d1","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.282505Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:9dfa5fcff8950e86d8c29b7e6c370fb4f446de98023d77c305675f99b3a40fbd","observation_id":"958d0713-330a-48ec-bb17-eb3ef55fe7c1","resolution":{"observed_at":"2026-08-10T22:41:36.701996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.682783Z","title":null,"venue":null,"work_id":"7c121ec4-cc0e-4cd9-8f50-018cf6de3a00","year":2020},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.287114Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:cbc58c4a9a7e50684a7f8b005a225030ab630e57c59c5d1d7786b2b988a9bd5b","observation_id":"2a9363cf-2b0d-4ab3-805f-e9b0d6d1733f","resolution":{"observed_at":"2026-08-10T22:41:36.687199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.666771Z","title":null,"venue":null,"work_id":"b0965695-2053-41e5-9e33-fc15f6946a74","year":2017},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.291708Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:6a5f7dc88cfc921c7bbc46946b2e53893bad5bf9967a10c3abdb374faa562cce","observation_id":"2c025e73-ffbe-4ee1-ba4b-8fabdf13b662","resolution":{"observed_at":"2026-08-10T22:41:36.672398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01901","last_updated":"2024-04-01T03:00:21Z","snapshot_observed_at":"2026-08-13T04:04:13.723601Z","submitted_at":"2024-03-04T09:59:48Z","title":"FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled Audio","version":2},"cited_work":{"arxiv_id":"2403.01901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01901","snapshot_observed_at":"2026-08-10T22:41:36.423446Z","title":"FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled Audio","venue":"cs.CV","work_id":"46400cfe-3db5-4ce6-8186-e7571dbe4dea","year":2024},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.296090Z"},"links":{"cited_paper":"/paper/2403.01901","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:4aa2fbc6cacb70dcf64976751e9ee2fad87f85e914b5d013eb04f9a316f3c67f","observation_id":"ab33fd14-6c68-45f3-8cb5-4f3847c96b45","resolution":{"observed_at":"2026-08-10T22:41:36.431025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.651416Z","title":null,"venue":null,"work_id":"2f5a8085-1245-465d-b90b-b56e7a3be545","year":2019},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.301064Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:5b3976ff664f67e2029c92af751afc2ea6258fee592234cd2562048dd98a74e6","observation_id":"2e150eb5-7ff7-4d11-8889-fdb2aca014de","resolution":{"observed_at":"2026-08-10T22:41:36.656378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13662","last_updated":"2023-06-25T11:42:52Z","snapshot_observed_at":"2026-08-13T12:54:19.561672Z","submitted_at":"2023-01-31T14:26:52Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13662","snapshot_observed_at":"2026-08-10T22:41:36.305336Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.305336Z"},"links":{"cited_paper":"/paper/2301.13662","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:b9356bb3f2a4ef37f317544dc033c5b96306fe252743dda1c7a9910a71e3e0a7","observation_id":"cf387bbf-4908-448c-aa4d-445cbbf9fb8f","resolution":{"observed_at":"2026-08-10T22:41:36.305336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.635026Z","title":"B.; Liang, P","venue":null,"work_id":"f437f4af-82f1-4589-8073-b00bd1e2ebde","year":2018},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.309424Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:3edf0b18c3dec4c8da447450852a21dee72a8218f11317e57064e61c09a84546","observation_id":"b9fa1489-4802-4ae7-84d6-fdd8b9f99561","resolution":{"observed_at":"2026-08-10T22:41:36.640536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-10T22:41:36.313840Z","title":"J.; Jia, Y.; et al","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.313840Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:a3fe20ac48eddcb113601f0841836e8afd28bba8299cac80bf757ba190c7c977","observation_id":"571f9b92-c45c-4a6c-9c2e-278b7a7da0ce","resolution":{"observed_at":"2026-08-10T22:41:36.313840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.619333Z","title":null,"venue":null,"work_id":"25838ac2-d2db-4969-aa9c-3fcf0e6c28c0","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.319416Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:4402e89865ef333e07cb5d9a4c8c7779c83556d07c1eb2a736854b6d4ba4f75e","observation_id":"d1210931-c7cd-4225-b7a7-4a6eeb7ad5af","resolution":{"observed_at":"2026-08-10T22:41:36.624566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.602983Z","title":null,"venue":null,"work_id":"f6aecbe0-71f4-43f3-9a48-a2e14187fed6","year":2023},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.325033Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:7be68953b61e731a180c2925f6f7393ba9919bbd75a91efea5d6e709bfb9c415","observation_id":"cad85ad3-c416-4df9-8b5d-b976b5068b48","resolution":{"observed_at":"2026-08-10T22:41:36.607585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.588339Z","title":null,"venue":null,"work_id":"ee99d6f0-6a84-43cd-92c6-edb14020a97a","year":2019},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.329492Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:47011ce57fa380f94cc5582335e8e5501da822bc583b845b0e87edb217d32fdc","observation_id":"c8c0ec08-566c-40ae-bb11-0d4a9aa0350a","resolution":{"observed_at":"2026-08-10T22:41:36.592283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.573197Z","title":null,"venue":null,"work_id":"db5be9f2-15ef-4661-acfc-ac887cb9a9da","year":2022},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.333820Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:3c9ddb97f0f828f06c274286909570635e9e76c35971e60bb860b3c0fb8065f7","observation_id":"d835e132-281f-430b-b7f9-8972c6784be9","resolution":{"observed_at":"2026-08-10T22:41:36.578244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.557189Z","title":null,"venue":null,"work_id":"17642aa7-3bb4-40db-899d-f858c833778c","year":2021},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.338027Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:fce2770ab52fd40c978e1ef2bbcbfb53bd16e97f3424555d5eedc75138ca8b92","observation_id":"cb0cc680-f348-47f6-a658-ba9264dd1e5b","resolution":{"observed_at":"2026-08-10T22:41:36.561815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.541983Z","title":null,"venue":null,"work_id":"b12fe5d0-766e-447d-aab9-6dc4b3f245f2","year":2022},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.342375Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:d9fa8b4ea6470b7371389ac53d46444b47632ea41014f29cc5cfd4100e612f3b","observation_id":"b42a7bf9-f3d8-48aa-91fa-894be044462d","resolution":{"observed_at":"2026-08-10T22:41:36.547121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.346197Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.346197Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:fe7040172218c46f56f281390473af36c2246d543506178082143e280ae92245","observation_id":"5f4b2ccb-86c0-4855-af29-4d57f3e7ba18","resolution":{"observed_at":"2026-08-10T22:41:36.346197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:41:36.351183Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:41:36.351183Z"},"links":{"citing_paper":"/paper/2501.03181"},"observation_digest":"sha256:0a4a8edd26228e418976ab9c963dc4412092a8cc1864dc029df04d66e1805801","observation_id":"0a573d03-4024-43aa-a807-665f0c373ba4","resolution":{"observed_at":"2026-08-10T22:41:36.351183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03181","last_updated":"2025-04-15T19:16:19Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T02:10:21.969103Z","submitted_at":"2025-01-02T02:00:15Z","title":"FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2501.03181."}