{"as_of":"2026-08-10T07:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23f1ef89d9192df54496a7405d11d5b0c8c21842efa55a2918ef26cd19323fd7","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:08.477884Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:04.712156Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:18:09.431567Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"cited_work":{"arxiv_id":"2505.19384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19384","snapshot_observed_at":"2026-08-07T14:18:09.431567Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","venue":"cs.CL","work_id":"34708acf-5c04-4dc3-a9fd-905bca875b11","year":2025},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.712156Z"},"links":{"cited_paper":"/paper/2505.19384","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:089c346dc658e9817b8f0b3d5a39ae649968580d3249e96a26b5b1e6ce0c1337","observation_id":"ce835dec-c20b-42c4-a41d-7727afbeac8c","resolution":{"observed_at":"2026-08-07T14:18:09.543726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19384/citation-record","integrity":"/paper/2505.19384/integrity","json":"/paper/2505.19384/citation-record.json","paper":"/paper/2505.19384"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"cited_work":{"arxiv_id":"2505.19384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19384","snapshot_observed_at":"2026-08-07T14:18:09.431567Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","venue":"cs.CL","work_id":"34708acf-5c04-4dc3-a9fd-905bca875b11","year":2025},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.712156Z"},"links":{"cited_paper":"/paper/2505.19384","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:089c346dc658e9817b8f0b3d5a39ae649968580d3249e96a26b5b1e6ce0c1337","observation_id":"ce835dec-c20b-42c4-a41d-7727afbeac8c","resolution":{"observed_at":"2026-08-07T14:18:09.543726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:13.243410Z","title":"We introduce a gradual style encoding method to obtain multi-level style conditions","venue":null,"work_id":"e644f0c3-74c7-439c-8904-0e3d0b755ec2","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.825643Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:680913ee8920d60da421aab562d72615664462c362e73fd0d445c86d2f507129","observation_id":"7aacea6c-3adf-47c1-80c9-6cc4fb0949de","resolution":{"observed_at":"2026-08-07T14:18:13.292857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:13.045375Z","title":null,"venue":null,"work_id":"42857325-8999-4d33-8070-3e41f0bd7d9a","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:04.943618Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:3b572faa71cac7733af546750da358491fbecefa83a4fe126ae70a56191831d2","observation_id":"c25a0baa-7a0e-42b4-91f0-d0b1ac87cad8","resolution":{"observed_at":"2026-08-07T14:18:13.145865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.931038Z","title":"Ask her to bring these things with her from the store","venue":null,"work_id":"32d3f5f1-f5d0-459d-bb15-2abd327d2902","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.074261Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:ac413565737271e3409979d236acf54ccfc0839ef6aaa5639778a7d3804d2c53","observation_id":"50062a17-ee7c-4a97-b88b-2d31e88a67a7","resolution":{"observed_at":"2026-08-07T14:18:12.976898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.791411Z","title":"Throughout the experiments, GSA- TTS shows superior audio quality in terms of naturalness, speaker similarity, and intelligibility compared to existing zero-shot models","venue":null,"work_id":"77129878-a095-4dd7-94fe-ddde15e61611","year":null},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.187510Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:5672fc8197f3cbdc9157a72ad200266b731b4df6f9193c8850f16981318b8183","observation_id":"83f7f23f-75c4-4562-b17c-c4e36e6ab778","resolution":{"observed_at":"2026-08-07T14:18:12.861566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-07T14:18:05.286666Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.286666Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:b9aeb097cefcdc9656480bc6fbd3581b0c1cab235a6359512319c421c97199cb","observation_id":"32086888-a169-42fb-9990-eb63c61fa8d8","resolution":{"observed_at":"2026-08-07T14:18:05.286666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:05.379053Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.379053Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:4a0e0b28e719cc8290e2e5689f41e0ceacd27e829bc6beb68d9f1b187cfc51ef","observation_id":"34a60102-c26d-4e55-8f67-a75a302b5731","resolution":{"observed_at":"2026-08-07T14:18:05.379053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.568975Z","title":"Conan: A complementary neighboring-based attention network for referring expression generation,","venue":null,"work_id":"ceb69103-6ba3-4e7f-bd63-d12179f6f5a2","year":2020},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.525986Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:8bc52cde94b695402a558d9421b67709a70e7477702b5e56dea21caab97e0440","observation_id":"36da0707-447f-4374-9210-3493f1a75a3a","resolution":{"observed_at":"2026-08-07T14:18:12.675839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.399620Z","title":"Visual question answering based on local-scene-aware referring expression gener- ation,","venue":null,"work_id":"d7a07d72-eb56-4c36-8749-42d727f2e5f5","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.638953Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:31acea37d3ccfb1d2101a7de37a86bd75a645a8829d2e1baeb568229ca25a0ba","observation_id":"3aae7709-bd4b-4b7c-ab37-489f55800d69","resolution":{"observed_at":"2026-08-07T14:18:12.453001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03136","last_updated":"2020-09-17T10:06:25Z","snapshot_observed_at":"2026-08-07T03:37:57.269526Z","submitted_at":"2020-04-07T05:44:58Z","title":"g2pM: A Neural Grapheme-to-Phoneme Conversion Package for Mandarin Chinese Based on a New Open Benchmark Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03136","snapshot_observed_at":"2026-08-07T14:18:05.745845Z","title":"g2pm: A neu- ral grapheme-to-phoneme conversion package for man- darin chinese based on a new open benchmark dataset,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.745845Z"},"links":{"cited_paper":"/paper/2004.03136","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:56ed76971ebbc402e1d92daee4055ee75e0034ef2162de4464392baae25d727a","observation_id":"8c4e8ad5-65b6-4d70-a95b-da301167af8a","resolution":{"observed_at":"2026-08-07T14:18:05.745845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.228745Z","title":"Good neighbors are all you need for chinese grapheme-to-phoneme conversion,","venue":null,"work_id":"976930ff-bd36-4726-8cd9-fe33a57beeff","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:05.901227Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:9f0ea196e8e87ddb8c5c061ec68a7de962898e9a187045ca8d3552229d90496e","observation_id":"30dadbdd-6bc3-4364-aa19-70120f4a80cb","resolution":{"observed_at":"2026-08-07T14:18:12.301738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.00196","last_updated":"2015-08-20T06:27:07Z","snapshot_observed_at":"2026-07-06T04:19:25.720017Z","submitted_at":"2015-05-31T05:14:06Z","title":"Sequence-to-Sequence Neural Net Models for Grapheme-to-Phoneme Conversion","version":3},"cited_work":{"arxiv_id":"1506.00196","doi":null,"metadata_source":"pith","pith_arxiv_id":"1506.00196","snapshot_observed_at":"2026-08-07T14:18:09.057356Z","title":"Sequence-to-Sequence Neural Net Models for Grapheme-to-Phoneme Conversion","venue":"cs.CL","work_id":"f62137cc-beec-4d3f-9c7a-3fbea2b6a32e","year":2015},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.067791Z"},"links":{"cited_paper":"/paper/1506.00196","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:b45f2c7c2fe992e56cf4b87a34211b2c74f8a95b026afacbd4e157be57463b94","observation_id":"b0bbd1b1-3613-4a44-9664-01eb2e105991","resolution":{"observed_at":"2026-08-07T14:18:09.167416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:12.058572Z","title":"A style- based generator architecture for generative adversarial networks,","venue":null,"work_id":"8c02d47d-21de-45fc-9fa8-15f4054c21a1","year":2019},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.180402Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:812a4362d8dc4ef5996bd92d68a65d04703d300622c0b7e7ad7b531bbd05aa1a","observation_id":"d82d0f7e-c53e-475f-a0dc-ee70dc5c716a","resolution":{"observed_at":"2026-08-07T14:18:12.119038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.859919Z","title":"Pvae-tts: adaptive text-to-speech via pro- gressive style adaptation,","venue":null,"work_id":"bc81e103-39c4-4065-b9d3-3ee09dfda28e","year":2022},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.339347Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:c3e858ea7da03138f6d19010d8a969baea40d8c7086e269547858fb523c16ed2","observation_id":"a1b82218-d836-4112-820e-8a4f228499f4","resolution":{"observed_at":"2026-08-07T14:18:11.947344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16171","last_updated":"2023-07-30T08:49:55Z","snapshot_observed_at":"2026-07-06T16:00:16.896971Z","submitted_at":"2023-07-30T08:49:55Z","title":"HierVST: Hierarchical Adaptive Zero-shot Voice Style Transfer","version":1},"cited_work":{"arxiv_id":"2307.16171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16171","snapshot_observed_at":"2026-08-07T14:18:08.869751Z","title":"HierVST: Hierarchical Adaptive Zero-shot Voice Style Transfer","venue":"cs.SD","work_id":"68112dcd-b6a2-47f2-be28-63f64ab7a2a8","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.503844Z"},"links":{"cited_paper":"/paper/2307.16171","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:eeed76237a35b3b9725120ea6ed39984ef706476808424d5b26f603aedc33b59","observation_id":"42cf2d74-98d2-4917-965f-8d404a0df081","resolution":{"observed_at":"2026-08-07T14:18:08.945303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.696018Z","title":"Zero-shot multi-speaker text-to-speech with state- of-the-art neural speaker embeddings,","venue":null,"work_id":"b288bdc7-e0c3-458b-b8de-a29f0274b6dd","year":2020},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.629135Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:7007648a3d5a1435db654661ec89eff7fed83df17625dcd9edd51af35f1cbb7b","observation_id":"4a0980d2-27ee-49d7-b599-0b4d3cb8b083","resolution":{"observed_at":"2026-08-07T14:18:11.775777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.589407Z","title":"Style tokens: Unsuper- vised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"cf65e988-a919-4d00-8046-297b39df1cf8","year":2018},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.760988Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:3358306e0928b3ac238794c83bb9eec0bca6dfd895f575b3cfa74ddc51a2a5e8","observation_id":"79c19d01-3b34-4e62-b915-fe224c8525be","resolution":{"observed_at":"2026-08-07T14:18:11.631621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.433220Z","title":"Tdnn: a two-stage deep neural network for prompt-independent automated essay scoring,","venue":null,"work_id":"845c7351-95a1-4330-b4ed-ebdd05f125ab","year":2018},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.856266Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:d30981ed915e61e9e1e604e1a6582a5d885bc1f54227bcc8a10c8af169b50145","observation_id":"d0b06a71-5979-4936-8527-1d03e1f09161","resolution":{"observed_at":"2026-08-07T14:18:11.515566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.286003Z","title":"Information sieve: Content leakage reduction in end-to-end prosody transfer for expressive speech synthesis.,","venue":null,"work_id":"841e6ac1-89f9-4e5a-ad85-5d496417799b","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:06.947126Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:e7987cd804ef22ccc343bb2326427c82cb16db184bd1236854655cbd1a82f9f6","observation_id":"9a48de4f-9606-421a-ad74-bc5d17d1e1f5","resolution":{"observed_at":"2026-08-07T14:18:11.335986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:11.108973Z","title":"Crossspeech: Speaker- independent acoustic representation for cross-lingual speech synthesis,","venue":null,"work_id":"092b9e46-3c3b-4b37-8a40-bd902d67700b","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.102922Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:02bc6a753ed6285686675731496cfb9ab9f2b998fd3dbd28d503775de56f0b73","observation_id":"6f816494-1e74-415c-9a47-d20afcc00c2d","resolution":{"observed_at":"2026-08-07T14:18:11.190563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.919694Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction,","venue":null,"work_id":"8606b456-e655-4ccb-b61b-f871bc29c1cd","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.200532Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:ef4f542f25662a8a31fc10fcbc661e379f1cc81f45490545fbf7456e4749a9c9","observation_id":"dc9dc158-6d42-4f83-9613-bf7fb5405cc5","resolution":{"observed_at":"2026-08-07T14:18:11.001014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.755846Z","title":"One tts align- ment to rule them all,","venue":null,"work_id":"060fd0a9-3fef-4817-abf3-cfa0ec0a0e46","year":2022},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.326279Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:818f181d00a05fb56a36423767f18c0b400c57aaf49d1321b884829b08472cdd","observation_id":"5f361644-17e6-46f0-a218-9ad3bd3cc1cf","resolution":{"observed_at":"2026-08-07T14:18:10.818672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.568086Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"99986da0-3c5a-4829-aca5-5d8cbd8601fb","year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.421867Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:a8d87d5211d771aeb90adecb26173609a52ecd52d687f570c4e962acb54a1df5","observation_id":"511571fd-7c12-4c64-8f79-a7ee29f2190a","resolution":{"observed_at":"2026-08-07T14:18:10.651076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13921","last_updated":"2024-01-25T03:37:23Z","snapshot_observed_at":"2026-07-06T17:20:11.913242Z","submitted_at":"2024-01-25T03:37:23Z","title":"Intelli-Z: Toward Intelligible Zero-Shot TTS","version":1},"cited_work":{"arxiv_id":"2401.13921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.13921","snapshot_observed_at":"2026-08-07T14:18:08.713556Z","title":"Intelli-Z: Toward Intelligible Zero-Shot TTS","venue":"eess.AS","work_id":"ed7b1776-08cb-4ecd-a554-8f04329b9716","year":2024},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.519604Z"},"links":{"cited_paper":"/paper/2401.13921","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:837095c55ed870d5e39ead2183425ebacb53769057089714d534be0d7d05d498","observation_id":"abfc3dad-dccb-4466-af57-5ea8cc7679f7","resolution":{"observed_at":"2026-08-07T14:18:08.762666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.385563Z","title":"Meta-stylespeech: Multi-speaker adaptive text-to-speech generation,","venue":null,"work_id":"21298278-81d1-47c7-8de3-7e7fea68bf8e","year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.615320Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:b9a8ccfe11be68dd4a74dbeb3df303d653e9c16a8c1dfc1547386b2915d3fdf0","observation_id":"530febdc-55c3-44f4-912a-7c9f92ebaa57","resolution":{"observed_at":"2026-08-07T14:18:10.472055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.248606Z","title":"Language modeling with gated convolu- tional networks,","venue":null,"work_id":"b7091a67-d2e0-4417-868a-0645d14a6185","year":2017},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.680288Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:f398ee60f18d7d4de95108c22cbb4cb7b0ba6f4f976778263de32f39616436c5","observation_id":"d4b4ffc6-4bca-48a4-b1be-c0671f60026c","resolution":{"observed_at":"2026-08-07T14:18:10.306328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.10077","last_updated":"2020-02-25T03:12:57Z","snapshot_observed_at":"2026-07-06T08:46:09.705605Z","submitted_at":"2019-12-20T19:49:32Z","title":"Are Transformers universal approximators of sequence-to-sequence functions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.10077","snapshot_observed_at":"2026-08-07T14:18:07.766917Z","title":"Are transformers universal approximators of sequence-to-sequence func- tions?,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.766917Z"},"links":{"cited_paper":"/paper/1912.10077","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:34d341665dddc7ce8f0ed37bc51db30ad97b455726f7c4a168b25e37837b3bd4","observation_id":"908a9664-6277-4c40-80e4-df1aa557d70f","resolution":{"observed_at":"2026-08-07T14:18:07.766917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:07.866011Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.866011Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:909f1ef6328fe66645409308b4d8f339b568c0c328ec371570160c8722d0730b","observation_id":"92165529-cd1b-4943-bb4e-605d0103a483","resolution":{"observed_at":"2026-08-07T14:18:07.866011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00993","last_updated":"2021-03-01T13:28:59Z","snapshot_observed_at":"2026-08-10T01:38:30.701285Z","submitted_at":"2021-03-01T13:28:59Z","title":"AdaSpeech: Adaptive Text to Speech for Custom Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00993","snapshot_observed_at":"2026-08-07T14:18:07.939965Z","title":"Adaspeech: Adap- tive text to speech for custom voice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:07.939965Z"},"links":{"cited_paper":"/paper/2103.00993","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:9ca927ede1536e74e779b021ccb7c5b899968a1803afe2d120112a86045eb529","observation_id":"c469f24b-e4da-4122-ade8-17851fad0e9d","resolution":{"observed_at":"2026-08-07T14:18:07.939965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T14:18:08.017944Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.017944Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:8bab90153fcd77c6a904c89b86b9e0c2f74140feb813a10fa6e223fc23f2b193","observation_id":"e2d9866a-37a3-49c7-8e15-4baa6a3afb64","resolution":{"observed_at":"2026-08-07T14:18:08.017944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-08-10T04:18:28.247428Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-07T14:18:08.101378Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.101378Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:2b481c628f2b3241898df4af0885780e557dde09b8b96d6ec46ae5d3da5ddf73","observation_id":"083a2173-1554-4c3a-90aa-8c2f0ab27e0a","resolution":{"observed_at":"2026-08-07T14:18:08.101378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:10.042278Z","title":"Superseded-cstr vctk corpus: English multi- speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"2745ce4b-b282-490e-b939-0bb0f78004fe","year":2016},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.199025Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:849ad460788e75a90092b03667cd9fed508b4d648946451eb6a2a7664f25c7eb","observation_id":"4e2af530-5dc2-40a6-a0ab-88ff40be5f0e","resolution":{"observed_at":"2026-08-07T14:18:10.122255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:09.877215Z","title":"Real-time voice cloning,","venue":null,"work_id":"49ec09a1-e071-432b-92b5-514bdeeec4db","year":2019},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.286530Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:1151c1d7626b816211177e9b0acb0c422588e0e89042067d31d28aa309a71475","observation_id":"6581b744-62a3-4261-8cce-dfe4a0615a55","resolution":{"observed_at":"2026-08-07T14:18:09.965005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:08.382649Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to-speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.382649Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:ce06ba20c5c55331ac07717ef202bfbdc5188cdd6f65b7f2fcaf779bcc25589d","observation_id":"25fc11c5-65a4-45d8-9609-30220110d0d5","resolution":{"observed_at":"2026-08-07T14:18:08.382649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:09.690513Z","title":"Hifi- gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"246f94be-5af7-4edf-a810-cc1915002b15","year":2020},"citing_paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:08.477884Z"},"links":{"citing_paper":"/paper/2505.19384"},"observation_digest":"sha256:b50131c84a9c101344e4fa399e71a24d82b831c57fd5998c7322019e99b382ca","observation_id":"bcbbaf2d-5d57-4e1b-ab85-35dafb344417","resolution":{"observed_at":"2026-08-07T14:18:09.743897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19384","last_updated":"2025-05-26T00:58:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T00:39:01.947064Z","submitted_at":"2025-05-26T00:58:16Z","title":"GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":21},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2505.19384."}