{"as_of":"2026-08-10T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c5643889aa612199bbba63147e44784065dc229e5bf8d539b4d087c966e5155","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:50:43.962905Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T22:26:14.531002Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:03:13.782299Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"cited_work":{"arxiv_id":"2502.01046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01046","snapshot_observed_at":"2026-06-29T08:03:13.782299Z","title":"Emotional face-to-speech.arXiv preprint arXiv:2502.01046, 2025","venue":null,"work_id":"0a584d30-7306-4ab2-aa95-760a8bd6a653","year":2025},"citing_paper":{"arxiv_id":"2605.30311","last_updated":"2026-05-28T17:53:27Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:53:27Z","title":"Archon: A Unified Multimodal Model for Holistic Digital Human Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:04.294439Z"},"links":{"cited_paper":"/paper/2502.01046","citing_paper":"/paper/2605.30311"},"observation_digest":"sha256:8b46b9f152df0ccff134026f94ae72d03ed759f603adca99c9ac0adaa8ba7361","observation_id":"107ff3ea-8160-4e01-853b-32bfeccd21b6","resolution":{"observed_at":"2026-06-29T08:03:13.784053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01046","snapshot_observed_at":"2026-07-30T22:26:14.531002Z","title":"Emotional face-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26742","last_updated":"2026-07-29T10:33:56Z","snapshot_observed_at":"2026-08-08T02:45:02.694487Z","submitted_at":"2026-07-29T10:33:56Z","title":"Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T22:26:14.531002Z"},"links":{"cited_paper":"/paper/2502.01046","citing_paper":"/paper/2607.26742"},"observation_digest":"sha256:833570eeb4e40d24c5e803418de8eaa40725481e6bec8a0ee725dd19a657f6d9","observation_id":"cc278dfb-24cf-454f-8d8b-6e0842a3be83","resolution":{"observed_at":"2026-07-30T22:26:14.531002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01046/citation-record","integrity":"/paper/2502.01046/integrity","json":"/paper/2502.01046/citation-record.json","paper":"/paper/2502.01046"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:43.604844Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.604844Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:e4dd5aa4ba8c76fa81e2176e0e371d9df63b61ee9552af9a5d938ee76bd3d8d9","observation_id":"5fc86a2a-63b2-486e-896e-48f12d1f1a68","resolution":{"observed_at":"2026-08-09T16:50:43.604844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:43.611319Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.611319Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:f657d9d8ebd12a7d9b044e050630342a09686e16fa495c80a233b9f6e6a8778e","observation_id":"4a82a1ca-ec06-4862-b264-10040089832f","resolution":{"observed_at":"2026-08-09T16:50:43.611319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-09T16:50:43.616656Z","title":"S., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.616656Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:7b3985e406b4737e36ac41ebde449f5d4709317fe0f924ee1c9d320db87ed355","observation_id":"8c784a1f-2db3-45d0-982b-b09334faca72","resolution":{"observed_at":"2026-08-09T16:50:43.616656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.136952Z","title":"SpeechT5 : Unified -modal encoder-decoder pre-training for spoken language processing","venue":null,"work_id":"1954efa2-2840-4beb-9b9c-0cd0b458bf42","year":2022},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.625383Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:30302bc8f1065bb947c3b2479c22ce30b5d3d1f0237df0a43cd31d373da17988","observation_id":"228fd9bc-ab5a-4b86-8cbf-37803986be1f","resolution":{"observed_at":"2026-08-09T16:50:45.141971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.120536Z","title":"D., Ho, J., Tarlow, D., and van den Berg, R","venue":null,"work_id":"52851fe1-df45-4c81-99d8-f1bdb9880c3c","year":2021},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.630497Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:b896e57451af1b1ece61666943b4fe608552741cf4cc720fb60a0c73d9ff5799","observation_id":"1ac5b807-2b4e-45ab-ad6b-f84a0dbfcb44","resolution":{"observed_at":"2026-08-09T16:50:45.125362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.105150Z","title":"W., Fidler, S., and Kreis, K","venue":null,"work_id":"3160ce5b-027c-46a2-b4fa-d922f6a71020","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.635301Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:6a3ce4b62dd2ce4a61dd7f01d5323a0045ce95144e96efe0d079f56f8233c5c4","observation_id":"bba212cb-3264-4084-8f3b-1641ebdffaea","resolution":{"observed_at":"2026-08-09T16:50:45.109829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.090531Z","title":null,"venue":null,"work_id":"ebb49890-90be-4e14-8753-06d9296cb115","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.640656Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:ccc40509ad42ff712626c8f855e2c5a854a41f9cc9c4acb43c2bbb90bf69e09f","observation_id":"4001e787-5070-46db-ab23-5ef9159ade57","resolution":{"observed_at":"2026-08-09T16:50:45.095205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.073877Z","title":"and Zisserman, A","venue":null,"work_id":"5796d5fd-fe43-434a-a504-de148d3b5c73","year":2017},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.645714Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:e32631b994d8d73de69a05e99a2f16fc1609d1fe49639ffe1aa556944446365a","observation_id":"0ef881d3-5e1b-429f-9015-27998dd27e63","resolution":{"observed_at":"2026-08-09T16:50:45.079738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.057235Z","title":"V2C: Visual voice cloning","venue":null,"work_id":"4e332c30-21bd-4c9c-affb-6713e25ae94f","year":2022},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.651033Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:20a8c0d9f2d795d8f5652e8e37937ccbbb7c61cf2bbad76cc0d38df949cdc306","observation_id":"7f473141-0a36-416a-a612-0b4510cb8fe6","resolution":{"observed_at":"2026-08-09T16:50:45.062125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.040970Z","title":"S., Nagrani, A., and Zisserman, A","venue":null,"work_id":"1fdfb5d5-c47c-4b81-b533-fc6da9fd2043","year":2018},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.655804Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:91d1f10244ab2dda1067e656271abd767db280a24c307ef830aa8c099da7d1c0","observation_id":"83a53979-b4a1-44f2-8a66-6c3259c198c0","resolution":{"observed_at":"2026-08-09T16:50:45.045828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.024416Z","title":"Learning to dub movies via hierarchical prosody models","venue":null,"work_id":"65226bfc-686c-431f-a180-ef1bcb5ffd42","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.661008Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:598d40c9200b3a67b82a2edb73f62b427d244d48b3e5c55d4a5292da2f344cd5","observation_id":"88efc1a8-5fdc-4fe4-89f3-006ecdceea6c","resolution":{"observed_at":"2026-08-09T16:50:45.030003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:45.008322Z","title":"StyleDubber : Towards multi-scale style learning for movie dubbing","venue":null,"work_id":"8c62cf0b-9887-4d87-9a80-465dbc0a61e0","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.665906Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:5053fcdd33fcb3d3e2a2a28c50985bdf9da6f6d273336eb0e351a93d3933e747","observation_id":"9d01dd86-d44e-436e-b922-49c544605764","resolution":{"observed_at":"2026-08-09T16:50:45.013211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.989676Z","title":"High fidelity neural audio compression","venue":null,"work_id":"46b6853f-9f36-44f1-871c-e2919f945c0e","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.670452Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:14e7a320a5abfc3f65732f764425d1807efff03013fae457b41a9e57aab2fc66","observation_id":"9b997226-46ca-46b9-b267-0d56038f4fa9","resolution":{"observed_at":"2026-08-09T16:50:44.994838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.973555Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"55fc7f4f-032d-49fc-855e-aa3007a25674","year":2022},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.675081Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:2702f1e773d0371a112a167aa6ef8f07566de4aa533d250ae391aadd3e9e182b","observation_id":"90c26510-fbdd-45a1-ac15-96b6d63c93ec","resolution":{"observed_at":"2026-08-09T16:50:44.978383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.958804Z","title":"and Shutov, V","venue":null,"work_id":"f9c8e96c-b33d-460f-90f4-36752db3b76e","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.679918Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:b28a0f69b4bd8d2cfd5162bfefd50d5dd643690573827bfe69f776c263a9b420","observation_id":"df752898-ec6a-4c72-8170-b51272e7ac6d","resolution":{"observed_at":"2026-08-09T16:50:44.963515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.943688Z","title":"Speaker adaptive text-to-speech with timbre-normalized vector-quantized feature","venue":null,"work_id":"bf142203-d8cb-4a13-b193-dcd37e41c746","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.684435Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:2941c780a0270128c0f6bceeb400d1c67f22f49382cbada23955df0aa13be985","observation_id":"201828de-4436-4332-9442-1cd2f16623d7","resolution":{"observed_at":"2026-08-09T16:50:44.948604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.928424Z","title":"Efficient emotional adaptation for audio-driven talking-head generation","venue":null,"work_id":"f3597866-acd5-4fbb-9135-1dc0d64c70a5","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.689001Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:07f2c793bfa3430fe287ad36465b7e6a7285e54e3b86288251c22049362dba28","observation_id":"43a1cc26-d1ee-4d6a-aba2-90c7f0720dbe","resolution":{"observed_at":"2026-08-09T16:50:44.933128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.913332Z","title":"Improving adversarial energy-based model via diffusion process","venue":null,"work_id":"5ef52b67-062e-4e07-ad4e-e6896959f89a","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.693418Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:deb9015610f04b1264c05363060e4541b75c12ef6ff4c9e1b4001eda3e28833f","observation_id":"6ce5e821-1e50-408b-9497-39e726890cc7","resolution":{"observed_at":"2026-08-09T16:50:44.918063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.896614Z","title":"Face2Speech : Towards multi-speaker text-to-speech synthesis using an embedding vector predicted from a face image","venue":null,"work_id":"26c6f883-d8e4-4e73-8764-a75d78e6dea4","year":2020},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.697928Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:604b6365052784abab4a87270bf07d85287efbfd2228c0d454541d007dfc5644","observation_id":"a6996e8a-99a5-4913-8545-3280c0c30699","resolution":{"observed_at":"2026-08-09T16:50:44.901896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.881642Z","title":"EGC: Image generation and classification via a diffusion energy-based model","venue":null,"work_id":"81b855be-fc40-4929-9a55-9984e6b5baca","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.702510Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:6625bf1c0becdeb28974c758aaaadcaebbec0803f43c06fb555d4064cb414746","observation_id":"0dcbacbf-7564-47ef-85b0-061428d49176","resolution":{"observed_at":"2026-08-09T16:50:44.886498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.864311Z","title":"Emodiff : Intensity controllable emotional text-to-speech with soft-label guidance","venue":null,"work_id":"3c808922-fcc6-465b-9568-c828babaf449","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.707083Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:66c16900f62ddf9e92a4dfaa830cf580ce2f75a762bce3942fde6c9d1f3c5f52","observation_id":"7fc0aca9-365b-4dad-96ae-1f9d0521f517","resolution":{"observed_at":"2026-08-09T16:50:44.870210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.847234Z","title":"An investigation of multi-speaker training for wavenet vocoder","venue":null,"work_id":"cc6685d4-917f-40c2-93e6-b9896704a701","year":2017},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.711763Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:8cbcbf5e52c5f244ee6f20f7650923cae7a90df2d1b2b19b5b3b46ea50a95f37","observation_id":"7870b00c-eed2-4471-bd49-c34b75d4b41c","resolution":{"observed_at":"2026-08-09T16:50:44.852149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.832470Z","title":"and Salimans, T","venue":null,"work_id":"96a1560f-5807-4a3f-af61-f65c0c01a8b7","year":2021},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.716419Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:8a2a59e68e9565429cb0ae7401b8f6bb44a12c2887a4691baa582ad76d7879d1","observation_id":"bc283b0d-32bc-419e-82b7-98c5ae23e077","resolution":{"observed_at":"2026-08-09T16:50:44.837142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.816796Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"b7ad13c6-fcf8-4ff9-ae9b-419d9f97a337","year":2020},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.721209Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:1401bf3eb4c2922919cd54a657da836f3303b828ea12fb4c1e1e0815f1841bc2","observation_id":"fe0ceb16-2d99-4d55-bc37-d4d864504a47","resolution":{"observed_at":"2026-08-09T16:50:44.821971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.801968Z","title":"and Johnson, L","venue":null,"work_id":"4288289d-3cbf-44d3-99a5-f1379163b4fc","year":2017},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.725912Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:87d72c7c0de09392ed9af455aacf0d7cc23baac84b9874e19bee535454201715","observation_id":"b596290c-7592-4d5b-ba2c-cdf081b6ec5e","resolution":{"observed_at":"2026-08-09T16:50:44.806622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.786818Z","title":null,"venue":null,"work_id":"5e4e8496-3cdc-4e0c-ad91-92ca5115ec65","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.730525Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:088da7f643e3460c505d1def152c3801a0fcadeca82056fb085fcdcad3282e5f","observation_id":"0eaf4e25-4cfb-41a3-9591-b6a03d4ab89a","resolution":{"observed_at":"2026-08-09T16:50:44.791581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05844","last_updated":"2024-12-28T12:31:01Z","snapshot_observed_at":"2026-07-06T16:45:32.248661Z","submitted_at":"2023-09-25T13:46:00Z","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05844","snapshot_observed_at":"2026-08-09T16:50:43.735052Z","title":"Face-stylespeech: Improved face-to-voice latent mapping for natural zero-shot speech synthesis from a face image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.735052Z"},"links":{"cited_paper":"/paper/2311.05844","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:a175156df3d204a2807efe3b38a6fa448bd656830ac811eea7f2222ec9239e1b","observation_id":"e6f77063-e505-4adc-bede-bbd5ddb52ac3","resolution":{"observed_at":"2026-08-09T16:50:43.735052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:43.740224Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.740224Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:5059e526abbed4dbf0e64b041a5f860a33b25289fd45f45b595fca30c05d060a","observation_id":"c1567119-44ca-4a97-bd0a-c4ba830e4cfe","resolution":{"observed_at":"2026-08-09T16:50:43.740224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.760113Z","title":"Speak, read and prompt: High -fidelity text-to-speech with minimal supervision","venue":null,"work_id":"6b1fe6d0-1e80-41c9-b2d7-053f84d4fcbb","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.744826Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:f4910f3d4a61134803d4941abfcbaa62b8a8429b47e5db7e3ba9736003db9bcc","observation_id":"4b7a60f2-fa75-42f0-83c8-bb0b68734653","resolution":{"observed_at":"2026-08-09T16:50:44.765114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03439","last_updated":"2016-06-10T19:42:57Z","snapshot_observed_at":"2026-07-06T04:59:33.186233Z","submitted_at":"2016-06-10T19:42:57Z","title":"Deep Directed Generative Models with Energy-Based Probability Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03439","snapshot_observed_at":"2026-08-09T16:50:43.749850Z","title":"and Bengio, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.749850Z"},"links":{"cited_paper":"/paper/1606.03439","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:7075f3485b79efd2b323ac3215cdc6553c92fbe9848644ca2aed588bf8e6c263","observation_id":"b425ebf1-8a0f-488a-a629-1bac92c2f7ba","resolution":{"observed_at":"2026-08-09T16:50:43.749850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.745075Z","title":null,"venue":null,"work_id":"e378a9e5-feec-42ee-8bb9-c312672160e2","year":2015},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.755018Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:763c9937db1ea27eddf1bf4a41766593961f31134ec3d108185863e7789f6559","observation_id":"67f83871-f69a-45dd-93dd-0b227ece1eae","resolution":{"observed_at":"2026-08-09T16:50:44.749956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.729383Z","title":null,"venue":null,"work_id":"55422200-09ef-407e-a22f-50d4412087b4","year":2018},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.759986Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:22719eee836386da3ed65984a4d451d4a7ab7c33d4b6ce65808ec7f377b1c4c1","observation_id":"02329e41-fe90-41a0-b8e9-deeb3d81768c","resolution":{"observed_at":"2026-08-09T16:50:44.734438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.714107Z","title":"S., and Chung, S","venue":null,"work_id":"3568f4cf-e163-4889-bfdf-57d88c7d0eaa","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.764727Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:b54c33a7e12791040e4b09c8823335fee2ee1c10dd31dd07cf31757e43285fb2","observation_id":"ef8844f7-c50f-409d-abfc-fe157fb86835","resolution":{"observed_at":"2026-08-09T16:50:44.718803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09802","last_updated":"2024-08-19T08:47:03Z","snapshot_observed_at":"2026-08-09T17:21:04.516991Z","submitted_at":"2024-08-19T08:47:03Z","title":"Hear Your Face: Face-based voice conversion with F0 estimation","version":1},"cited_work":{"arxiv_id":"2408.09802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09802","snapshot_observed_at":"2026-08-09T16:50:44.132621Z","title":"Hear Your Face: Face-based voice conversion with F0 estimation","venue":"cs.SD","work_id":"58892156-dd13-4a27-a588-e2629b1112d8","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.769527Z"},"links":{"cited_paper":"/paper/2408.09802","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:65f77463a2708dc57b11a4a6a81ac639b80c999f76fd3e7c5d78ebefacf567ff","observation_id":"7badaced-9882-408d-af97-7de45d9d8ef8","resolution":{"observed_at":"2026-08-09T16:50:44.138143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18398","snapshot_observed_at":"2026-08-09T16:50:43.774408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.774408Z"},"links":{"cited_paper":"/paper/2404.18398","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:d26a65df2d39e45d3d0715ab19766acfe6ee263ac5056d84c2e421148a3fa2fd","observation_id":"e147df56-4a2d-43a1-a161-0e72be10814a","resolution":{"observed_at":"2026-08-09T16:50:43.774408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.697632Z","title":"A., Han, C., Raghavan, V","venue":null,"work_id":"d6350879-41ee-4e98-9354-343583c6b00f","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.779447Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:4ec3783866495441dffe9f46a6162958397334277ad232569a014af1aa2a47f6","observation_id":"694e3347-2324-4734-a331-2f27283a99a4","resolution":{"observed_at":"2026-08-09T16:50:44.702628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.681878Z","title":null,"venue":null,"work_id":"ce9604d7-bdd4-4173-87fc-3c160f9f1787","year":2022},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.783888Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:a59aa05b447a9d5495039f212b629d60ed5b88a0dd208ba516ab07e380868317","observation_id":"75876484-b02c-44ce-a574-ebd534e4271b","resolution":{"observed_at":"2026-08-09T16:50:44.686565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.661910Z","title":"Towards a simultaneous and granular identity-expression control in personalized face generation","venue":null,"work_id":"451a32ba-6dc5-4cdf-8ff9-a7872dc9d7df","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.788335Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:c1e7d9e26bae96c96a373efd742da34777d49b7ba3a60cb7e50c92f94efa5112","observation_id":"4eb7e847-dc45-48ec-a169-667fce75cfed","resolution":{"observed_at":"2026-08-09T16:50:44.668157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.645861Z","title":null,"venue":null,"work_id":"dbc8982e-0bd3-43c6-8b1e-4f8f56243caa","year":2018},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.792876Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:292450cd5c33b841a4f5c14775f5fb3579e4ef17849a9e0deb2d2054cc8d801d","observation_id":"b071e055-cb81-4e53-b369-b905175722f6","resolution":{"observed_at":"2026-08-09T16:50:44.650702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.631276Z","title":"and Hutter, F","venue":null,"work_id":"dbb19bf9-28fc-4430-a6fa-0ae5399f8170","year":2019},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.797480Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:747fea06c6e6ad4cc77bb6248ceacb135401600584dbfa50fb3e4a233c0f393b","observation_id":"05cb4b77-1554-4915-a91f-04da4147c73a","resolution":{"observed_at":"2026-08-09T16:50:44.635934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.616196Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":"d3032ef1-73b9-4753-ba1b-31bc95a41231","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.801954Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:57abf0683728eb33d874672e4746831beebbc890c58ff09e09ff5b24d7844d55","observation_id":"8884668d-d95d-4799-9f20-f312e427d6c6","resolution":{"observed_at":"2026-08-09T16:50:44.620993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.600350Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":"7834cea7-8b39-447c-9fb4-f80807c6da49","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.806366Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:d537f537f6c655337378295d57b43ff1124714960b736abe3af3c27c40af966a","observation_id":"487895ef-ea72-49bc-aca9-17699ef1d044","resolution":{"observed_at":"2026-08-09T16:50:44.605341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12149","last_updated":"2023-02-12T11:04:37Z","snapshot_observed_at":"2026-08-09T13:26:22.972374Z","submitted_at":"2023-01-28T10:23:44Z","title":"POSTER++: A simpler and stronger facial expression recognition network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12149","snapshot_observed_at":"2026-08-09T16:50:43.810875Z","title":"POSTER V2: A simpler and stronger facial expression recognition network","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.810875Z"},"links":{"cited_paper":"/paper/2301.12149","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:fa45cc1bd19e487b15880109014833ff45c5db57c2a59357d9b0772aa7dba33c","observation_id":"95de6b4f-48c9-4fcd-821b-bae05433aa0c","resolution":{"observed_at":"2026-08-09T16:50:43.810875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.584815Z","title":null,"venue":null,"work_id":"eeea3611-3f73-42ea-b855-a6db4e76b4ad","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.816300Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:271346f204e6c13ea2a65b9055bb49e731667ab8cfc8fd0b1174b5f70766edf9","observation_id":"7282e835-8cd3-4b1b-a943-84abdcd98820","resolution":{"observed_at":"2026-08-09T16:50:44.589517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.569897Z","title":"Concrete score matching: Generalized score matching for discrete data","venue":null,"work_id":"8d6d637a-d6a4-4207-83b6-be0493a82b5f","year":2022},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.820798Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:76b4ed7efcc8b4867e92cc470954750110e8c0b5df45cf210565946f9ff418c9","observation_id":"83977cf2-68c9-4aee-8aa0-e5e0e741473a","resolution":{"observed_at":"2026-08-09T16:50:44.574543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04380","last_updated":"2024-10-06T07:20:58Z","snapshot_observed_at":"2026-08-03T07:51:42.862937Z","submitted_at":"2024-10-06T07:20:58Z","title":"HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04380","snapshot_observed_at":"2026-08-09T16:50:43.825414Z","title":"HALL-E: hierarchical neural codec language model for minute-long zero-shot text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.825414Z"},"links":{"cited_paper":"/paper/2410.04380","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:4212f40f20ce877a06bf56c29a98025c2ad695cb5274babaed2099d5ed547128","observation_id":"7e9dd3b9-8940-4494-a023-8fe45fcc6085","resolution":{"observed_at":"2026-08-09T16:50:43.825414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01572","last_updated":"2025-03-25T18:50:23Z","snapshot_observed_at":"2026-08-07T21:23:44.310196Z","submitted_at":"2024-06-03T17:51:54Z","title":"Unlocking Guidance for Discrete State-Space Diffusion and Flow Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01572","snapshot_observed_at":"2026-08-09T16:50:43.830118Z","title":"Unlocking guidance for discrete state-space diffusion and flow models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.830118Z"},"links":{"cited_paper":"/paper/2406.01572","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:b0ed7a0fc38deea3900e30007cecedc5e7bc1916c56d64c8ace6d275c9b9e303","observation_id":"afdb7d01-8e67-4cb2-a693-ad523e366df3","resolution":{"observed_at":"2026-08-09T16:50:43.830118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-09T16:50:43.834886Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.834886Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:36c668a4d73671d7860e67e5cc7fee625de54df6b3c5e2d073e35eb61863d00e","observation_id":"21379b9e-a8fb-44e7-953f-b299025db48a","resolution":{"observed_at":"2026-08-09T16:50:43.834886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.554542Z","title":"Visual form predictions facilitate auditory processing at the n1","venue":null,"work_id":"57cf47e7-df3c-4092-945e-3339cce8d468","year":2017},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.840930Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:5db2baa9832eb9b4c7f2eca572efa0f2167d9c637265a91cb77d88a99bcef716","observation_id":"4fec4e79-0764-4560-826d-869f4fbe7d28","resolution":{"observed_at":"2026-08-09T16:50:44.559350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.540321Z","title":"and Xie, S","venue":null,"work_id":"879f98a3-0f4a-4dec-9962-581b6e75626d","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.845641Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:fa1686f1691a331d6d37d35f0889e33a9371c641e3362c304c242dfdea9f8c71","observation_id":"d8b23048-440a-428e-8eeb-b845b9442490","resolution":{"observed_at":"2026-08-09T16:50:44.544780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.524856Z","title":"Hearing faces: Target speaker text-to-speech synthesis from a face","venue":null,"work_id":"7b41997d-96c1-4024-8d95-aeedc94aef0d","year":2021},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.850193Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:19012b3b5ea7525c0daca839fc340ae47306e1a7d619596574f94817ad7ef4c5","observation_id":"5ee9044b-52e0-4d3c-b73f-0b813e45db40","resolution":{"observed_at":"2026-08-09T16:50:44.530430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.510391Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":"6f7600a8-f74a-4a98-9cb3-718a12334062","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.854922Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:7cde0a6277a2d00d292a53c4a9bf32abb414ec247010aed53d82a3761ebc3324","observation_id":"e6f466b0-cfd9-4b98-8ff9-fbdf8debc2f3","resolution":{"observed_at":"2026-08-09T16:50:44.515015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.496040Z","title":"A., Bengio, Y., and Courville, A","venue":null,"work_id":"337d6c55-ea6a-46a3-b4cf-00dabb53b525","year":2019},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.859270Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:9e545ab4036b56cb045fd4650ab70a18b1d6f388f774a94c094bc2b67a50e217","observation_id":"f319cb0e-356d-4538-b860-072a1b7ee870","resolution":{"observed_at":"2026-08-09T16:50:44.500660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.481474Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech","venue":null,"work_id":"fa4b0163-efaa-4cc8-8917-9d54515de20f","year":2021},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.863822Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:1ce14a3c7825306fdba04369876ca10dac27cba31c82b04be0fd17c3e65735da","observation_id":"d808a201-85eb-4347-9039-17a490fddc9e","resolution":{"observed_at":"2026-08-09T16:50:44.486244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.466311Z","title":"J., Jin, Q., and Guo, B","venue":null,"work_id":"d5d12f4f-1c41-4619-a3ad-9a77b1d19b33","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.868134Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:f7e298bf80f1dea721dee9d61a012841d75d9a6b23cb87f1cdb10c8d48264d72","observation_id":"b467fb4c-8a20-45dc-97aa-341d8420bd84","resolution":{"observed_at":"2026-08-09T16:50:44.471369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.451829Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":"83988e87-4bef-413b-969a-aa47dad17885","year":2015},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.872724Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:2870947865c10d6e9065edde76553cacb17143ac849941a5cd3387ec262a85cc","observation_id":"1e9a56be-cefb-4282-99bd-0850c636f88e","resolution":{"observed_at":"2026-08-09T16:50:44.456550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.436597Z","title":"NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":"bf195ccf-ad27-454f-a3b6-09bc8d35fe77","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.877177Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:968295aa7fc4dc44b2fee4be9376ddc30f69d9729aba4a1c2e5a6a5b524129db","observation_id":"a14e57f9-f64d-4bb3-924b-27c0db7805b6","resolution":{"observed_at":"2026-08-09T16:50:44.441381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.421524Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"ba0cb5ce-c414-4a4c-9d90-5117a272d0bf","year":2021},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.881486Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:0a6eff9dafcddcd0d037a39145ea2b66eeb84f725ce896317718801aa15ffb2a","observation_id":"1e4269af-0220-4bbe-936b-d2ea22cbce0b","resolution":{"observed_at":"2026-08-09T16:50:44.426446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.406485Z","title":null,"venue":null,"work_id":"9060a86b-05d4-48e6-82ae-5f971c090d83","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.886082Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:a485a8e34f02a1ea1997dc39dc6fd495e1cd579aee78e0be49fe772e25482e78","observation_id":"a4f43710-7e79-4477-b3fc-93cce2bdb6cb","resolution":{"observed_at":"2026-08-09T16:50:44.411261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.392112Z","title":"Attention is all you need in speech separation","venue":null,"work_id":"115ea07c-77f2-4fcc-8754-b97e17aa2ef0","year":2021},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.890897Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:03d4df66c09072374031d6244a1ef374037cc9e0e09aeec7840c4e4669f3cd25","observation_id":"46ef9fa6-b41a-465a-9401-7e7a96969847","resolution":{"observed_at":"2026-08-09T16:50:44.396768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.377766Z","title":"Score-based continuous-time discrete diffusion models","venue":null,"work_id":"db1c44ef-36e7-4129-83df-335b30db4cd0","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.895228Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:d034cc71937ccefe712cea83d321b80cce6fac5e2406a5a9dad1f6f446b1c226","observation_id":"40747989-37d4-44d9-9ee2-83348a6edb91","resolution":{"observed_at":"2026-08-09T16:50:44.382407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.362906Z","title":"and Fostick, L","venue":null,"work_id":"75849d56-3080-437c-b3f3-9aa0cd378dcf","year":2016},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.899637Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:c1fbfe6fbe4fe8d256c7b1eaf7240c73ade049c58c47a93bc31dfc5146cef3ea","observation_id":"67357277-30e9-4a4e-867e-96a6c819c725","resolution":{"observed_at":"2026-08-09T16:50:44.367580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.347456Z","title":"and Hinton, G","venue":null,"work_id":"f98658e9-fc27-48a6-b04c-601ed4188bc9","year":2008},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.904043Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:171bd1cfb7285e36ce3f82018bdaf78ecfeb111bbd91f52bcac4b494d364b60e","observation_id":"47f5461b-95aa-4381-a1bf-dba0f1d2c3ea","resolution":{"observed_at":"2026-08-09T16:50:44.352130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.331281Z","title":"and Vanathi, P","venue":null,"work_id":"30d7770f-d27f-4b7d-a96e-5d643ab964b8","year":2006},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.908535Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:d1172028be59b4909a82231d6eaa3dc0ed29647c1f7e4625f1c2894e9a6a04bf","observation_id":"51fafd75-1f5b-4a6c-bde3-d68fa5123445","resolution":{"observed_at":"2026-08-09T16:50:44.336646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.315300Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":"cca2c11f-4a49-40ba-b4d0-1b8d9403e903","year":2017},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.912912Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:4300c584c26b041e1d6e830aba57f50758e97987bb6226790cd84996e4c5e041","observation_id":"47d97212-12bb-42ba-ba0d-5eb6f0572c2b","resolution":{"observed_at":"2026-08-09T16:50:44.319986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.300275Z","title":"Generalized end-to-end loss for speaker verification","venue":null,"work_id":"d065e33c-bb34-41ee-9100-81e849233071","year":2018},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.917352Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:3f156683ee04d355c19b996e4791b9ee11e2623646b0b93279608d3e370b0b90","observation_id":"505ab147-c5c9-486f-80ae-edd969806099","resolution":{"observed_at":"2026-08-09T16:50:44.304950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-09T16:50:43.921870Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.921870Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:9d724b5ac8203b729879b41df3eee1484fafdfd657003eb24d5360452c0abb48","observation_id":"7215bd37-6571-45cc-9288-b4aa56e3d42f","resolution":{"observed_at":"2026-08-09T16:50:43.921870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.285490Z","title":null,"venue":null,"work_id":"860ff042-a9f7-486f-92e4-393918d836d5","year":2020},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.926776Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:b29553080b1a71f0d83b25232f135d6ab417bdf5b3a3cc5c22f900f52bc4aca8","observation_id":"f604beb7-c73f-410f-b68d-c28c69d65f01","resolution":{"observed_at":"2026-08-09T16:50:44.290346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.269685Z","title":"J., Battenberg, E., Shor, J., Xiao, Y., Jia, Y., Ren, F., and Saurous, R","venue":null,"work_id":"eceef892-0a4e-40b8-ac02-0dfa45668c03","year":2018},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.931175Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:cd8b9306488a8fd2443fbc304c0bbcb6f97897a6d12045f8d69cfc3c6547bafb","observation_id":"7424b5fb-18ff-4f5e-b46e-3ec3804fc604","resolution":{"observed_at":"2026-08-09T16:50:44.274761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-09T16:50:43.935681Z","title":"MaskGCT : Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.935681Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:c863aecf0a640ee351216892e3ab9495fa69d733d0c859a142d1616acb41e892","observation_id":"637cb4a9-52c4-4d75-abe9-81f326f42521","resolution":{"observed_at":"2026-08-09T16:50:43.935681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.253854Z","title":"DCTTS: discrete diffusion model with contrastive learning for text-to-speech generation","venue":null,"work_id":"a29b7e62-9815-4c0d-8220-99fd7b4f4071","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.940309Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:8dac67f263159d0c987ded310669a48b4c5be5eed0c3e23fcedf23b13f1e5ede","observation_id":"0137943d-8457-47dd-bd86-8f5564f3e4b2","resolution":{"observed_at":"2026-08-09T16:50:44.258792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02939","last_updated":"2023-03-08T03:06:47Z","snapshot_observed_at":"2026-08-09T04:29:49.678210Z","submitted_at":"2023-03-06T07:17:15Z","title":"FoundationTTS: Text-to-Speech for ASR Customization with Generative Language Model","version":3},"cited_work":{"arxiv_id":"2303.02939","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.02939","snapshot_observed_at":"2026-08-09T16:50:44.000352Z","title":"FoundationTTS: Text-to-Speech for ASR Customization with Generative Language Model","venue":"eess.AS","work_id":"b338705d-e0af-4fd4-bb26-6fd4de06c206","year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.944733Z"},"links":{"cited_paper":"/paper/2303.02939","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:2a692e7eabecca7587f6bf15285f0b316cc06c683ba29c633800d39a55fe0efa","observation_id":"b1310808-0727-4144-83c7-132e9c8ab306","resolution":{"observed_at":"2026-08-09T16:50:44.007474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:43.949596Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.949596Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:6a6c9dee4dc1e9f38ecf17b9580c8e33ad75e2aea46226778383d7a60850684e","observation_id":"a275ec1a-d076-4ea0-ba38-02192b2dc34d","resolution":{"observed_at":"2026-08-09T16:50:43.949596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.226837Z","title":"SoundStream : An end-to-end neural audio codec","venue":null,"work_id":"3cfde006-a027-443e-9244-1a4e08f73c06","year":2022},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.953942Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:a6e7659efcebce9262949622b34b36ac60302882a72e1dee3eb2bdf5f5378006","observation_id":"7af2d74f-5042-49d0-aaad-507e99131309","resolution":{"observed_at":"2026-08-09T16:50:44.232022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.210824Z","title":"SpeechTokenizer : Unified speech tokenizer for speech language models","venue":null,"work_id":"2a735d09-dc2e-4427-b2a5-1ecda5cccc2c","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.958341Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:dfa23d1e4396b157b36dac5cc67b600b1b9ebc634ca7a1a58badf58471f117f2","observation_id":"1f177877-1668-4d84-9463-adb26d58ab72","resolution":{"observed_at":"2026-08-09T16:50:44.216139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:50:44.195802Z","title":"Srcodec: Split -residual vector quantization for neural speech codec","venue":null,"work_id":"d046e127-1db6-453c-a119-4e59a53c8cc7","year":2024},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.962905Z"},"links":{"citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:6617cbbf96aba67d3ab1809c5df53c1f7652afa2eb7275c7c9a2a3aafead72cc","observation_id":"1302bf96-acf4-4fef-90e8-34fb688272a8","resolution":{"observed_at":"2026-08-09T16:50:44.200703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T16:44:26.721667Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":51},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 2 inbound Pith citation observations for arXiv:2502.01046."}