{"as_of":"2026-08-15T12:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d6c5f8747f7d934106d44be0fbe68738598ed1da37e96219de095070f6335e1","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:03:09.237635Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:03:09.067600Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:03:09.354907Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"cited_work":{"arxiv_id":"2506.03554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03554","snapshot_observed_at":"2026-08-07T11:03:09.354907Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","venue":"cs.SD","work_id":"c29092f4-e14d-413b-80ea-ff394476df06","year":2025},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.067600Z"},"links":{"cited_paper":"/paper/2506.03554","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:38f06e7c9bb2635b7e242b7f36a36b121a8f15bf22b6c4335390449fb72bd928","observation_id":"a8644e48-5651-4605-8c30-96adb3581fc6","resolution":{"observed_at":"2026-08-07T11:03:09.358217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03554/citation-record","integrity":"/paper/2506.03554/integrity","json":"/paper/2506.03554/citation-record.json","paper":"/paper/2506.03554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.751330Z","title":"One key component of this progress is neural vocoders, which synthesize audio waveforms from acoustic fea- tures","venue":null,"work_id":"5083f74d-e3b9-4bd2-9d9c-d53443c2a5b2","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.063905Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:c1ff53c052bf0e68f8089468f1f6c6fba57a4b2a9b36098960118564b92db28d","observation_id":"2efe9a14-4863-4878-84fe-2e09512cdfbe","resolution":{"observed_at":"2026-08-07T11:03:09.753919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"cited_work":{"arxiv_id":"2506.03554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03554","snapshot_observed_at":"2026-08-07T11:03:09.354907Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","venue":"cs.SD","work_id":"c29092f4-e14d-413b-80ea-ff394476df06","year":2025},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.067600Z"},"links":{"cited_paper":"/paper/2506.03554","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:38f06e7c9bb2635b7e242b7f36a36b121a8f15bf22b6c4335390449fb72bd928","observation_id":"a8644e48-5651-4605-8c30-96adb3581fc6","resolution":{"observed_at":"2026-08-07T11:03:09.358217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.743692Z","title":"throughput We analyze the relationship between latency and throughput via block streaming synthesis using several neural vocoders","venue":null,"work_id":"334fbbe4-ba0d-4c96-84ca-e62684474ea0","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.070559Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:0066436954416bfb38ff059217b3d31018d71a0c003c9ab1ca51096da8653d94","observation_id":"8c077676-0d9f-4557-8c55-2aa96aa17995","resolution":{"observed_at":"2026-08-07T11:03:09.747067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.736145Z","title":"Wavehax and MS-Wavehax utilized F0 for generating prior signals, whereas other models concate- nate it with the mel-spectrogram, resulting in a 101-dimensional input feature","venue":null,"work_id":"73d7b77a-0bc0-4c60-8155-0064751d3042","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.073128Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:17cf85fb953d97dc53d89fde0741a1f0afc64db1e2927a7ab488af04de79b141","observation_id":"b598b463-06d1-4f0e-8c14-9b8e05cc4152","resolution":{"observed_at":"2026-08-07T11:03:09.739379Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.728939Z","title":"Next, we evaluate its speech quality under causal and non-causal condi- tions, compared to the vocoders described in Section 3.1","venue":null,"work_id":"faa6916d-13af-42b4-83c1-bdb70fd41955","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.075967Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:ebf2a7136259e6e4e6c268b0e17d8e7c6a367721fff952bd756e9fe5ba0ee0b5","observation_id":"8a563839-47b6-4221-ad58-b0e62c571d16","resolution":{"observed_at":"2026-08-07T11:03:09.731975Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.700459Z","title":null,"venue":null,"work_id":"dae9c06f-cf91-4470-b564-89fd45c21f2c","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.084068Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:3e35d4c83514700b196307c95f79b33152f8ba085b6ca58a36c6e818818a7306","observation_id":"494c870b-c8e6-48d0-ac85-86a610e4cf49","resolution":{"observed_at":"2026-08-07T11:03:09.704463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.710136Z","title":"Our analysis revealed that streaming throughput de- pends on overhead from data and parameter loading as well as computational complexity","venue":null,"work_id":"74d121de-845e-4590-bd52-26962b66f601","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.081498Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:daa3095348b0a65e88b4f6ea454af9f6928bfa3ff1e0c5cbccc346a4b8ecf302","observation_id":"13749803-0ece-4dba-907e-46532bc52575","resolution":{"observed_at":"2026-08-07T11:03:09.714250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.690732Z","title":"Generative Ad- versarial Nets,","venue":null,"work_id":"312182f3-39fc-48f5-8aae-9bf41fda47aa","year":2014},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.086457Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:23eb541726bb2a74afaa2bd66e9736ea57f9477e954b420fb56214ca0ee64541","observation_id":"740076dc-5257-4382-91a1-d16bf60bde88","resolution":{"observed_at":"2026-08-07T11:03:09.694699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.681209Z","title":"MelGAN: Generative Adversarial Networks for Conditional Waveform Synthesis,","venue":null,"work_id":"c2e2e419-0405-43f8-ab3d-51ded6ba3c98","year":2019},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.089020Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:e128a3965524e623ce6887cc9c08e4361540c26e67f043da708c23f1aebdefdf","observation_id":"1fa39c74-ec56-4793-a3e2-f68e742d76e0","resolution":{"observed_at":"2026-08-07T11:03:09.685081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.671378Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"5fed0ffd-7de4-4d70-91c5-c19e92898006","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.091510Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:9c9f9c969862f40085c4bcc6b31cc4d488b38ccd424d7126f7b8b87128794679","observation_id":"a7037021-c55d-4037-ae5e-bf7ddcf94ce2","resolution":{"observed_at":"2026-08-07T11:03:09.675221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.660277Z","title":"iSTFTNet: Fast and Lightweight Mel-Spectrogram V ocoder Incorporating Inverse Short-Time Fourier Transform,","venue":null,"work_id":"ed9611dd-6253-43da-b3db-880a9f19c2ab","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.095332Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:7c477393b2f5ab9ac254ce2bb1d7dad86b6c9e5a252ec9811c194f9988f13bf4","observation_id":"f31581db-3072-41f3-9d29-a576c8f35400","resolution":{"observed_at":"2026-08-07T11:03:09.664184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.650286Z","title":"iSTFTNet2: Faster and More Lightweight iSTFT-Based Neural V ocoder Using 1D- 2D CNN,","venue":null,"work_id":"f49d5b3e-6d5e-43ad-a2cc-3355d4e49cab","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.098995Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:7c0896b15f3d7aef9e5e305024e0db920a2b96d500d9da16712a83808d3336c8","observation_id":"d080a97c-771d-4f78-a9d7-2ee0952f5583","resolution":{"observed_at":"2026-08-07T11:03:09.654149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.640345Z","title":"APNet: An All-Frame-Level Neural V ocoder Incorporating Direct Prediction of Amplitude and Phase Spectra,","venue":null,"work_id":"93001a2b-8021-410f-8f04-167fc32086ee","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.102904Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:a93b0668f5773aad1a4274753f524291c1fdfae997b61da95b50eb6c836ed81f","observation_id":"8574965a-ee7c-4caa-b7cf-233f52f36f98","resolution":{"observed_at":"2026-08-07T11:03:09.644340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.630706Z","title":"V ocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"106da819-9f35-47d1-999b-3262b8711d83","year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.106552Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:d03de220911a89e17d1a895f4c914587bbb6ba9bfc0a3da822a6fc59a40fa6e5","observation_id":"ba0011ed-c82a-492f-b77c-94be19529883","resolution":{"observed_at":"2026-08-07T11:03:09.634797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.569978Z","title":"AC-VC: Non-Parallel Low La- tency Phonetic Posteriorgrams Based V oice Conversion,","venue":null,"work_id":"d45e298c-48b8-43e0-8742-33fe1602136f","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.140221Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:0c4321a79ef9e06135a97ded911aab29299f6b828d31a58945c8f5c3decf24dd","observation_id":"05937b8d-3552-4d4a-97ab-122d250385ef","resolution":{"observed_at":"2026-08-07T11:03:09.574398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.620591Z","title":"Low-latency real-time non-parallel voice conversion based on cyclic variational autoencoder and multiband WaveRNN with data-driven linear prediction,","venue":null,"work_id":"e442a7e6-5c82-4a05-a31b-4c086fed6b4a","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.113880Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:39f78046d4f9a9a5f05c577cf1339420388a562113851a17462e95eeb24766aa","observation_id":"dcec3a08-34b7-45bf-a098-15219e497a6e","resolution":{"observed_at":"2026-08-07T11:03:09.625084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.611310Z","title":"An Investigation of Streaming Non-Autoregressive sequence-to-sequence V oice Con- version,","venue":null,"work_id":"87c693f6-eedd-425a-8eac-327c460855cf","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.117576Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:d61422ca0da1003a165abd89c2348b6b8d2042ae6cec90750af1aac560f3ba4a","observation_id":"cad249c8-ffe8-45be-a510-2acefc71d38f","resolution":{"observed_at":"2026-08-07T11:03:09.615267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07288","last_updated":"2022-06-15T04:04:14Z","snapshot_observed_at":"2026-08-13T15:23:41.414979Z","submitted_at":"2022-06-15T04:04:14Z","title":"Streaming non-autoregressive model for any-to-many voice conversion","version":1},"cited_work":{"arxiv_id":"2206.07288","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.07288","snapshot_observed_at":"2026-08-07T11:03:09.339873Z","title":"Streaming non-autoregressive model for any-to-many voice conversion","venue":"cs.SD","work_id":"99f51134-bd20-48b0-9914-647d4adcf170","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.121069Z"},"links":{"cited_paper":"/paper/2206.07288","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:b4946e1d0cc219041519b86db8d395b4798be332a5eac3a3b2b15cd9d0b1fa33","observation_id":"6ed446e1-84ab-4cac-9979-056845733a0b","resolution":{"observed_at":"2026-08-07T11:03:09.347294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.124691Z","title":"Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convo- lution and Harmonic Prior for Reliable Complex Spectrogram Es- timation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.124691Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:120a67026c0221d3d47231c052950330479d3febd6ddf7858413e9a1ec81c9e7","observation_id":"a06f59ae-1390-4505-ac30-b3f3a3e5baa3","resolution":{"observed_at":"2026-08-07T11:03:09.124691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.601785Z","title":"Multi-Stream HiFi-GAN with Data-Driven Waveform Decomposition,","venue":null,"work_id":"3130f8e1-22fe-46b4-b80c-c852d2804d8d","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.128505Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:8132f3fe583fc9895e052899a2c5596ff2ec874b4cb42e286c2b377ebd9cc981","observation_id":"374ba3cc-00c5-42de-9e55-74dce93c86fe","resolution":{"observed_at":"2026-08-07T11:03:09.605762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.591599Z","title":"Implementation of DNN-based real-time voice conversion and its improvements by audio data augmentation and mask-shaped device,","venue":null,"work_id":"090e4846-3cbf-4021-9c50-8163a733eb37","year":2019},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.132327Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:a14d201f3ba555de656f08a0d93e1f9d6205cb3dbaba415dbe4483867664ce6c","observation_id":"6dd36464-7ac6-40f8-b187-9d9a403187c4","resolution":{"observed_at":"2026-08-07T11:03:09.595860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.581421Z","title":"Real-Time, Full-Band, Online DNN-Based V oice Conversion System Using a Single CPU,","venue":null,"work_id":"457b88c1-68c9-4aad-9636-f58ccd74b119","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.136347Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:c766736e8faefe3a95ed1a3b5fcb2d825347722f2febc3eafc38e227bcf5c650","observation_id":"edb05948-0859-4b18-ab05-6af0f6f97abd","resolution":{"observed_at":"2026-08-07T11:03:09.585450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.491859Z","title":"Fregrad: Lightweight and Fast Frequency-Aware Diffusion V ocoder,","venue":null,"work_id":"434d9543-b852-40a2-8b32-f5bab8279fee","year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.169405Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:153e2a19f0170fd2012ec56c706900e0afed5c65dc3260a8c94f5aab3142c4b0","observation_id":"21d67325-1765-4f3a-ace1-81d526740d34","resolution":{"observed_at":"2026-08-07T11:03:09.495782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.559725Z","title":"Incremental Text-to-Speech Syn- thesis with Prefix-to-Prefix Framework,","venue":null,"work_id":"aab3bf09-9f69-4d67-8751-1311c2a95331","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.144149Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:0a478556d421069922768012e21645e1420ebadd397bfb915f1be9f449d8dca7","observation_id":"1e4c5a7c-83fe-45ba-8011-8ee975ddc3de","resolution":{"observed_at":"2026-08-07T11:03:09.563771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.550049Z","title":"Neural iTTS: Toward Synthesizing Speech in Real-time with End-to-end Neural Text- to-Speech Framework,","venue":null,"work_id":"c6a0d403-af25-4352-bc22-9af2026b6338","year":2019},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.147888Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:94bc212e5337574fd53014cf6757a506938d345eeec075ae95e603720147b728","observation_id":"6adba2ad-acc7-4c00-8f9e-fcfce809fe87","resolution":{"observed_at":"2026-08-07T11:03:09.554309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.540014Z","title":"High Qual- ity Streaming Speech Synthesis with Low, Sentence-Length- Independent Latency,","venue":null,"work_id":"f47d29e5-d5c7-4cdc-967f-3e725e1e45e6","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.151384Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:46caeaffe23b67cfd79bc6fbcb8ef20a8181659d91a60df788c734d4bf8022d2","observation_id":"8cf19f83-7642-40c9-a31d-c81d3184e6f2","resolution":{"observed_at":"2026-08-07T11:03:09.544086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.530749Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":"7da78f2c-a22b-480f-acca-7fdd60d54286","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.155362Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:6480a8ca8f29960ed54d224d1b1669e7619d0bef3f937f1f05d2c5918ae5a217","observation_id":"f573e596-7e4c-4d92-942e-0198c6822814","resolution":{"observed_at":"2026-08-07T11:03:09.534826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.520956Z","title":"Design and evaluation of parallel quadrature mirror filters (PQMF),","venue":null,"work_id":"6886d0f5-ba7c-4f39-b674-e52fbcdcfce8","year":1983},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.159040Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:dfcc29e7358cbcb21da5842f8cb8c8725791c40e8cfe59a1ca14318b6fbe75de","observation_id":"58d7f9f8-d176-4597-b13b-69bfbb865c2b","resolution":{"observed_at":"2026-08-07T11:03:09.524902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.510606Z","title":"Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech,","venue":null,"work_id":"7549a8cb-f9c2-4ebd-b571-8baf14bc96c4","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.162515Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:c38f6cdb19393909132b9f4e5f4e8f16f1339c4ce88b347041bbdc0b53bf79ed","observation_id":"79ddeef0-150f-4f4b-8d6b-192b688b8db6","resolution":{"observed_at":"2026-08-07T11:03:09.514584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.500930Z","title":"Fre-GAN: Adversar- ial Frequency-Consistent Audio Synthesis,","venue":null,"work_id":"e6209eb7-c165-4729-978a-6a5e1f4560b2","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.165700Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:e40b0a5c1f3d7a9454658c84ede216d8c9a9dd8e56a296c64f779b04aab54fb0","observation_id":"4a2daaeb-b25f-4cfd-ae22-8b1c61441a2b","resolution":{"observed_at":"2026-08-07T11:03:09.505221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.434670Z","title":"Harvest: A High-Performance Fundamental Fre- quency Estimator from Speech Signals,","venue":null,"work_id":"111ac268-6577-4310-bcc3-4153e611be07","year":2017},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.202363Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:a7fa76aa6865ba19a1ec0f2aec5ffdb252734034d80a08daed8dce17ba98a26f","observation_id":"6edea2f9-de32-41e3-b0d2-d48901f5b0bf","resolution":{"observed_at":"2026-08-07T11:03:09.438612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.482121Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assess- ment of telephone networks and codecs,","venue":null,"work_id":"2efc4218-fdf1-4718-b9fb-da41778f0fc0","year":2001},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.175261Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:5d99b311b7baa5c8bed08193bf84dc2112d64ec97396409e20cbc434b04ed635","observation_id":"dbbbdaa0-e510-4d26-9275-092f49970bb8","resolution":{"observed_at":"2026-08-07T11:03:09.486771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.472995Z","title":"UTMOS: UTokyo-SaruLab System for V oiceMOS Challenge 2022,","venue":null,"work_id":"70c746fd-7c3a-417b-9fc0-27184395b868","year":2022},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.179126Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:1ffffaf81170449997ce5e409f05767b87e0c6d64f58f9599198dbce7bdad702","observation_id":"d1992397-2144-459f-bdb1-fbcb3c816a92","resolution":{"observed_at":"2026-08-07T11:03:09.476818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.463901Z","title":"Lightweight and High-Fidelity End-to-End Text-to-Speech with Multi-Band Generation and Inverse Short-Time Fourier Transform,","venue":null,"work_id":"ca76bf0f-6236-49b0-912a-ad5dadaae12b","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.183017Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:620610599c48e42e37c3a972d7c9c6858140007382247ae6dcbcd2f50309ec98","observation_id":"4269562f-f098-431a-b358-b1c06ec36040","resolution":{"observed_at":"2026-08-07T11:03:09.467769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.719702Z","title":"Aggregate","venue":null,"work_id":"99fb27ec-ccff-4ba4-95ec-7da2b469de09","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.078818Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:70ea60ce3a4314bb645a201e8c717e2a7b400b63833a5671249d29185f2b75fd","observation_id":"bfbb5934-af47-45e0-97ac-8b70ef0a9ed6","resolution":{"observed_at":"2026-08-07T11:03:09.723585Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.454298Z","title":"Developing Real-Time Stream- ing Transformer Transducer for Speech Recognition on Large- Scale Dataset,","venue":null,"work_id":"20535a4d-60d0-4d16-97f6-2526915c901b","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.186530Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:283884b57a58817c02eefdd3ce979cab5b693e7863d05d4b713ab53090e7c813","observation_id":"627f44c1-21ec-4db1-b577-10cc0ac60fb8","resolution":{"observed_at":"2026-08-07T11:03:09.458455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T11:03:09.190271Z","title":"Layer Normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.190271Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:264e5949397f44c4c6e6d1ba8d5fe5a9560410aaf2ee32d0b21fd5b6a0cf15b1","observation_id":"de3f64f1-3a9d-4411-a7e0-03fffb896ebe","resolution":{"observed_at":"2026-08-07T11:03:09.190271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.444823Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift,","venue":null,"work_id":"4d4fcd99-f538-473b-8772-ceb496af06d7","year":2015},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.194351Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:2fe30aab530a83520ab937742564cb9bea339a28a17b05cb657b7c35e79b8e77","observation_id":"98d3165d-2e01-430b-a263-ff9dd63d3cf4","resolution":{"observed_at":"2026-08-07T11:03:09.448743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-14T12:49:46.383600Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-07T11:03:09.198316Z","title":"JVS corpus: free Japanese multi-speaker voice corpus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.198316Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:1d367d42c458d8ffa7c22155eebee69ba2936e2635f3ebbfc3a2935d7266b0fe","observation_id":"cd0c716b-1b79-40bb-9899-f87c7b297c54","resolution":{"observed_at":"2026-08-07T11:03:09.198316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.424676Z","title":"BigVGAN: A Universal Neural V ocoder with Large-Scale Training,","venue":null,"work_id":"a65e1954-8f37-436b-b9e0-d7227ba3319f","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.206313Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:3811942a81c8d55f0c3f250539507f37fc3a0690ba821e5f38598fd73ebbb243","observation_id":"4b513dda-1176-4d8c-ab2c-e07f04eb3d9d","resolution":{"observed_at":"2026-08-07T11:03:09.428879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.414800Z","title":"UnivNet: A Neural V ocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation,","venue":null,"work_id":"54aef059-4f46-43d2-bfe8-b17a51dce3ad","year":2021},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.210135Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:4d9f01644881f84528c07ad5fa5044a30b3d9d92dc2038556815e423341eaf1c","observation_id":"5128eaf3-493a-497b-9c95-2a6f70845f3a","resolution":{"observed_at":"2026-08-07T11:03:09.418774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-14T20:19:26.882819Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-08-07T11:03:09.213625Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthe- sis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.213625Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:5e663eac5db72418baa1b6c20e791a2624aa2a2c08599d16eb0278cd980d547a","observation_id":"467c237e-279d-48b1-87dd-b5a5fb64ba68","resolution":{"observed_at":"2026-08-07T11:03:09.213625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.404880Z","title":"Matcha-TTS: A Fast TTS Architecture with Conditional Flow Matching,","venue":null,"work_id":"8e140e12-2396-453c-bde3-199631f8d204","year":2024},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.217924Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:557b973bb9d97aa49d9b8ced277a00b049038eb6af504fcb2f3a4184f603a059","observation_id":"9c145dd8-8aec-461c-b1cf-893d1d63cae1","resolution":{"observed_at":"2026-08-07T11:03:09.408771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.397697Z","title":"Attention is All you Need,","venue":null,"work_id":"3b48dff0-3b98-4d7c-885c-a94172086e73","year":2017},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.221656Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:b10b67bf536a1b589bb3923f3f1ff6450793ff4ded5e47e3272af18c9768794a","observation_id":"81d8bd2e-2a86-4167-b268-d0ff0e89b1a6","resolution":{"observed_at":"2026-08-07T11:03:09.400038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.388619Z","title":"Flow Matching for Generative Modeling,","venue":null,"work_id":"13053606-bde8-4465-9e95-2818ebc1b7d3","year":2023},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.225535Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:5aea7e95714e4666a19bc22e4906e9d88bec3454b92bcd33cd3d119e7c20217e","observation_id":"a7c8b92f-06ea-41dc-a53e-f2366fc7cbe3","resolution":{"observed_at":"2026-08-07T11:03:09.392214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.379764Z","title":"Matcha-tts","venue":null,"work_id":"b9a9396a-1e62-4c88-8d3b-846462fedc25","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.229084Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:1e315b97459569639266ae9671c80997bf92f7b4a0e13612220775b86827d82d","observation_id":"567c61dd-d2d7-4d1b-99f0-b6810a1a0687","resolution":{"observed_at":"2026-08-07T11:03:09.382954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.371208Z","title":"jsut-label","venue":null,"work_id":"5cc391fc-6316-4aaf-95c7-b25d2f295564","year":null},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.232821Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:321ef79e23ecf65ee46fdac8fb35003cdbd803b2cbc362775958aff359df0782","observation_id":"7d0d27f3-920b-440a-b8bc-65fd66d3f718","resolution":{"observed_at":"2026-08-07T11:03:09.374466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:03:09.363001Z","title":"What the Future Brings: Investigating the Impact of Lookahead for Incremental Neural TTS,","venue":null,"work_id":"210cb04c-5ca7-4c5b-b4fa-c950aea868fc","year":2020},"citing_paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:03:09.237635Z"},"links":{"citing_paper":"/paper/2506.03554"},"observation_digest":"sha256:3ff8d193e8891dfae89f26986f850303e4694ef54a1e2e42f03ed78c5d41dbbf","observation_id":"17222672-317a-478c-8678-94b2f5604230","resolution":{"observed_at":"2026-08-07T11:03:09.366129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03554","last_updated":"2025-06-04T04:18:15Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T07:14:18.655202Z","submitted_at":"2025-06-04T04:18:15Z","title":"Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2506.03554."}