{"as_of":"2026-08-09T22:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06715dc76229b7ce2241ddf4811bcd4f9d07a0baef1f302665c27d2e23e748a6","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:57:23.386903Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T21:17:48.886421Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:16:12.319512Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"cited_work":{"arxiv_id":"2507.14534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14534","snapshot_observed_at":"2026-07-01T20:16:12.319512Z","title":"Conan: A chunkwise online network for zero-shot adaptive voice conversion","venue":null,"work_id":"ec4092cf-4bfe-4b36-8979-093007faa456","year":2025},"citing_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T14:20:01.885544Z"},"links":{"cited_paper":"/paper/2507.14534","citing_paper":"/paper/2604.12456"},"observation_digest":"sha256:312c1da9404f9e026444d750a61be4d9c88a4936bff60d372967a1f399a9b151","observation_id":"316d538f-1f07-4436-96e3-d160f469a179","resolution":{"observed_at":"2026-05-10T14:20:29.828049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"cited_work":{"arxiv_id":"2507.14534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14534","snapshot_observed_at":"2026-07-01T20:16:12.319512Z","title":"Conan: A chunkwise online network for zero-shot adaptive voice conversion","venue":null,"work_id":"ec4092cf-4bfe-4b36-8979-093007faa456","year":2025},"citing_paper":{"arxiv_id":"2605.30940","last_updated":"2026-05-29T07:28:24Z","snapshot_observed_at":"2026-08-02T04:51:57.721054Z","submitted_at":"2026-05-29T07:28:24Z","title":"Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T21:17:48.886421Z"},"links":{"cited_paper":"/paper/2507.14534","citing_paper":"/paper/2605.30940"},"observation_digest":"sha256:92d1def2b3d6e644ae24dfaca71ffe30d4ba1b0865902ddf6cf71cb732197fae","observation_id":"67293642-b383-4b5c-8fda-7708339eed94","resolution":{"observed_at":"2026-07-01T20:16:12.321170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14534/citation-record","integrity":"/paper/2507.14534/integrity","json":"/paper/2507.14534/citation-record.json","paper":"/paper/2507.14534"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.312946Z","title":"StreamVoice: Streamable context-aware language modeling for real-time zero-shot voice conversion,","venue":null,"work_id":"dad6e819-49f5-40e1-a5ec-202e87bc8f35","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.058155Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:c0bfae497164b0d1bbd872c958d500ee8ef057c6d14c840e8377276ae8e68838","observation_id":"cedb4dbb-0fa5-4623-bdf8-6a18757a6d5d","resolution":{"observed_at":"2026-08-06T15:57:29.317774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.295535Z","title":"Vqmivc: Vector quantization and mutual information-based unsuper- vised speech representation disentanglement for one-shot voice conver- sion,","venue":null,"work_id":"771d3133-5724-4fa7-8ee8-06556db224b3","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.124148Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:0adfd9d804bc47d3f95644c7e6199595432d5386afb43b9e3394e86c260d5724","observation_id":"77e58ac2-15a7-4164-87f8-b751dd5abf80","resolution":{"observed_at":"2026-08-06T15:57:29.301228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.279434Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss,","venue":null,"work_id":"e75e9751-7a7a-40fd-82ae-6d1f1bdc99db","year":2019},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.205359Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:c69df36de7501a6f8904594c9e863145a93d90cef3c673358f6a1c7178f2d8f8","observation_id":"6e9ee150-7279-4d55-a59c-157e9a33a042","resolution":{"observed_at":"2026-08-06T15:57:29.284013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.264604Z","title":"Controlvc: Zero-shot voice conversion with time-varying controls on pitch and speed,","venue":null,"work_id":"9b9141c9-2b7c-40d7-bb5f-0d572db585ac","year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.327182Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:3e3d98a433b03a900ea25afa48b836b691b2d26952762417812fff7068009415","observation_id":"7dc0f064-a8a4-444a-98f9-1b116e5e5a28","resolution":{"observed_at":"2026-08-06T15:57:29.269197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.249449Z","title":"Streamable Speech Representation Disentanglement and Multi-Level Prosody Modeling for Live One-Shot V oice Conversion,","venue":null,"work_id":"0a169f36-b3dc-44bb-aa50-bbac524bbccd","year":2022},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.387237Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:282bc8e63f190e0aeb5e856c5ceb33c5c34fa00f63257e0fd15291992e1425b7","observation_id":"5b65b122-8ace-47f4-8fcd-ad16828b37ba","resolution":{"observed_at":"2026-08-06T15:57:29.253979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.234757Z","title":"Streamvc: Real-time low-latency voice conversion,","venue":null,"work_id":"3e259ad6-064f-497b-8622-a0447629df88","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.429437Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:b53899699e099a3013c7f3f93a90fdc60edb4636f061447bb36f3c795c315eb9","observation_id":"db8fc721-dc17-4452-8afd-bd97b4987118","resolution":{"observed_at":"2026-08-06T15:57:29.239188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14910","snapshot_observed_at":"2026-08-06T15:57:20.468550Z","title":"Tcsinger 2: Customizable multilingual zero-shot singing voice synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.468550Z"},"links":{"cited_paper":"/paper/2505.14910","citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:fae07d9e53781919af0bb209bf033bb02f6afcc88d8e61d2442512fc655a58ed","observation_id":"5fd170c3-41f0-43cd-92d2-d365d32067cf","resolution":{"observed_at":"2026-08-06T15:57:20.468550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:20.561847Z","title":"Isdrama: Immersive spatial drama generation through multimodal prompting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.561847Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:111fe5171d4f63202642e24a4323b4e802e3ecf1ff50a082087aa7ec755fe5ba","observation_id":"a770f3f7-d1b2-4e12-ab4a-000c0cdf4d44","resolution":{"observed_at":"2026-08-06T15:57:20.561847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.219354Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"442ccd02-e199-4b96-85cd-8182e1addf20","year":2022},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.642241Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:5d6804c4d8261c3a6b0ab75776235eca356610975f81d877c94d41136bb89f7a","observation_id":"2cb7ec70-99cb-4f02-9f9f-5c5fcae37b5e","resolution":{"observed_at":"2026-08-06T15:57:29.224119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:20.755757Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.755757Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:df0112c91b93ab18fb9f4b24e8ec4bc79d133e9f971d40e742c910e3d07a654c","observation_id":"d56cdefa-73c8-4ca9-8f2f-eabfa2678478","resolution":{"observed_at":"2026-08-06T15:57:20.755757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.192285Z","title":"Phonetic pos- teriorgrams for many-to-one voice conversion without parallel data training,","venue":null,"work_id":"38a7260c-2a8d-4bc0-9961-224e28d0ca20","year":2016},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.822747Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:e75b567c712894e27f4f021ddbe49dbf57f9146a0b3aaba8c12fb32252df83a8","observation_id":"61d08d86-e121-47f0-8d73-727c8a3b5f26","resolution":{"observed_at":"2026-08-06T15:57:29.196974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.176233Z","title":"Starganv2-vc: A diverse, unsuper- vised, non-parallel framework for natural-sounding voice conversion,","venue":null,"work_id":"8f9d62e1-26f9-4811-8c55-4c9a0f769fe3","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.892516Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:21a7e14cd3d920e0b1693b9385665129bf935bd92ebd5cdbb701bc9ef92f7c1e","observation_id":"7a52f3ad-e015-45dc-8824-89840f32ea6a","resolution":{"observed_at":"2026-08-06T15:57:29.180932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.161722Z","title":"End-to-end streaming model for low-latency speech anonymization,","venue":null,"work_id":"526b8713-2ecc-4562-b9d6-31b52719b31a","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:20.956605Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:3aad4f108ddbde3172a494f2cc5d6ce700775c52cb8d43b6deaf2af5d97a3c5b","observation_id":"91124d21-72f8-47bc-90d3-cf7e4999109a","resolution":{"observed_at":"2026-08-06T15:57:29.166104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.147388Z","title":"Contrastive predictive coding supported factorized variational autoen- coder for unsupervised learning of disentangled speech representations,","venue":null,"work_id":"e2177c26-5752-474f-9039-7bf575f98b67","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.020533Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:62ea0128f378368284242ba27767cf42d0ac18ee810f67c470b915a9d0689909","observation_id":"6a760ef3-0401-43bf-bd99-f3d878867ffd","resolution":{"observed_at":"2026-08-06T15:57:29.151943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.132457Z","title":"Neural analysis and synthesis: Reconstructing speech from self-supervised representations,","venue":null,"work_id":"892e3360-2ca9-4d59-a978-b8b41596ec74","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.081301Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:3dd226ebdee5fc5e7b108f49902f7df8c54b2c755bce3e38ad467b443a6658db","observation_id":"96a890f9-a376-4685-8dd6-17cd857f0e3c","resolution":{"observed_at":"2026-08-06T15:57:29.136970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:21.209242Z","title":"Lm-vc: Zero-shot voice conversion via speech generation based on language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.209242Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:09533b60e51bcab51af9f3146906d998d5424419249dfbfe9384dfd12640dc0d","observation_id":"1b9e8804-0a17-4676-90be-d75e25940d71","resolution":{"observed_at":"2026-08-06T15:57:21.209242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.106926Z","title":"An investigation of streaming non-autoregressive sequence-to-sequence voice conversion,","venue":null,"work_id":"a0e65183-5035-4b12-904f-20ffb7fd4cb5","year":2022},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.349497Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:e9e8b6c5bc57082304c3f72e7ced68281c9c748570f469a6a1be735289707860","observation_id":"8c907b39-3523-476b-88cc-fb4502ebad7b","resolution":{"observed_at":"2026-08-06T15:57:29.111657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:29.021968Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"37b7af2f-124c-4242-a4e6-c7a9c73759b6","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.451568Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:efa1abc1a9ada2632f5b8fa2e43720d65e3e2ea92cd75ddf0d3494af90f2cd0d","observation_id":"7b4fa9f6-cead-40b6-99e0-3546858cac79","resolution":{"observed_at":"2026-08-06T15:57:29.078539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:28.958470Z","title":"Non- autoregressive sequence-to-sequence voice conversion,","venue":null,"work_id":"b13ed942-778b-4420-ac73-4bb175738e30","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.521693Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:ce0202c6246beb19bf28c1e88c7ab9e96ace679eaa236f89f2bc92a58d5439ca","observation_id":"20d40fe8-b908-477f-8a3b-8040792bb92c","resolution":{"observed_at":"2026-08-06T15:57:28.987253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06900","last_updated":"2021-04-14T14:48:22Z","snapshot_observed_at":"2026-08-09T00:50:40.961052Z","submitted_at":"2021-04-14T14:48:22Z","title":"FastS2S-VC: Streaming Non-Autoregressive Sequence-to-Sequence Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06900","snapshot_observed_at":"2026-08-06T15:57:21.646838Z","title":"Fasts2s-vc: Streaming non- autoregressive sequence-to-sequence voice conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.646838Z"},"links":{"cited_paper":"/paper/2104.06900","citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:d8670f53e45cdfa688b6701cedb94d64bd36f74dea5421550b0aa6d2c0e9e6bb","observation_id":"99af9cd1-284f-41ba-b65d-df1f8d8ce90e","resolution":{"observed_at":"2026-08-06T15:57:21.646838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:28.902525Z","title":"Streaming voice conversion via intermediate bottleneck features and non-streaming teacher guidance,","venue":null,"work_id":"c8791147-e720-4508-86b9-d015eb27ff77","year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.788288Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:e90b407ce6f3d7a6a2e829476ea11e52c81a5fe5dad1df4df5f5bf7a51c7c926","observation_id":"413f6a08-89af-41ff-aa52-b939132cfaf1","resolution":{"observed_at":"2026-08-06T15:57:28.922925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:26.740024Z","title":"Dualvc 2: Dynamic masked convolution for unified streaming and non-streaming voice conversion,","venue":null,"work_id":"8fd98e57-80c9-43ac-812f-6725e96f0d10","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:21.890854Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:e17ba01d1687db5652db8e53022d52682f40b4591814bf0a557fc688707df6c5","observation_id":"d80a12b9-c892-4f3d-b002-b69ee35365d6","resolution":{"observed_at":"2026-08-06T15:57:27.723679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:26.156092Z","title":"Alo-vc: Any-to-any low-latency one-shot voice conversion,","venue":null,"work_id":"21cb6a1c-6b96-407a-88ad-ae64d213ed3a","year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.006855Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:81346f5dd4287ae6a84b4883d6e1482e4302d32e5e668699349b71c26697a15a","observation_id":"d29c1678-9cc9-459f-bf71-ea0f94c461cd","resolution":{"observed_at":"2026-08-06T15:57:26.410264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.926098Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"d33525dc-b0ae-42da-91fe-2b79c4e167ab","year":2020},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.085174Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:3ef47c41d3c49c0cec1112fe9d683a287a2e38cd82c010aaeb45b45b5afed7f7","observation_id":"29fa0b9f-0546-45cd-9807-a5059a1343d4","resolution":{"observed_at":"2026-08-06T15:57:26.009254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:22.132763Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.132763Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:f1d16fe86cfd1285a406f795bb09086d0a344d27149cdff32c75956793d13b62","observation_id":"7f253c7c-e32b-4f9c-9cbe-6eff216ecd08","resolution":{"observed_at":"2026-08-06T15:57:22.132763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.781535Z","title":"Attentron: Few-shot text-to- speech utilizing attention-based variable-length embedding,","venue":null,"work_id":"ad616317-9e16-4c31-adac-24b438529a5e","year":2020},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.184149Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:615c32aaf7a17b025ec5c34780f4bfe367d13a2e2b4fa916a2119ace9a968223","observation_id":"f02d83d8-498d-4482-b44d-365368ac1e63","resolution":{"observed_at":"2026-08-06T15:57:25.846045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.583013Z","title":"Normalization driven zero- shot multi-speaker speech synthesis","venue":null,"work_id":"f9c7baf6-9169-4e96-a67b-8e384e6b9f73","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.238284Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:efc885a930e799300c8ff39945fd9665356bd58fbf338295c6aebf30c06e3477","observation_id":"6bf52a16-2edb-4b8d-8599-c30401a74128","resolution":{"observed_at":"2026-08-06T15:57:25.663916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02271","last_updated":"2022-04-05T18:06:21Z","snapshot_observed_at":"2026-08-09T19:14:28.791424Z","submitted_at":"2021-08-04T20:13:00Z","title":"Daft-Exprt: Cross-Speaker Prosody Transfer on Any Text for Expressive Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2108.02271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.02271","snapshot_observed_at":"2026-08-06T15:57:23.668471Z","title":"Daft-Exprt: Cross-Speaker Prosody Transfer on Any Text for Expressive Speech Synthesis","venue":"cs.SD","work_id":"163bb1f2-de6c-451e-bada-ff1a589529b8","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.279661Z"},"links":{"cited_paper":"/paper/2108.02271","citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:0bd6c5dd7c759e821db25f093f98a3003e5ed99d24daa07b217eac2b1e1d6948","observation_id":"6914e1ce-e1a9-4fd4-84a3-6b8419a2dfcc","resolution":{"observed_at":"2026-08-06T15:57:23.740340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.447072Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to-speech,","venue":null,"work_id":"ae6ce47d-e4e5-411e-972a-9687c27c6c81","year":2022},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.352742Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:048990c5fa037108ba08607462c8c5003870432e6c77b84abe19c2ff8d809c83","observation_id":"59926bab-b637-4466-ac8a-85b31fa7c54d","resolution":{"observed_at":"2026-08-06T15:57:25.482486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.318054Z","title":"Styler: Style factor modeling with rapidity and robustness via speech decomposition for expressive and controllable neural text to speech,","venue":null,"work_id":"566be0f0-29fc-4a04-a03c-28b8a637d7bd","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.405331Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:1e3ac11ffc812e49d2682d60ca37b70441fdc3273d1453b6002f30e46ad32e51","observation_id":"14f439df-7073-4c64-87c6-958de311e3f5","resolution":{"observed_at":"2026-08-06T15:57:25.383341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.189618Z","title":"Mega-tts 2: Boosting prompting mechanisms for zero-shot speech synthesis,","venue":null,"work_id":"6a504a5d-7017-4565-9754-9e497c5d579f","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.447883Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:8256e70183393e07c5fb29f3036a31d8e9c35ad0bc19a7f077900737b9c0e6bb","observation_id":"e10b327d-5ade-4bca-85bb-6fc4cceee77a","resolution":{"observed_at":"2026-08-06T15:57:25.247102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:25.036000Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"bfcd44f2-a4e9-4223-9ea7-9c4edd5c5767","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.539901Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:d41f2d7b6cc6c02ff6734d83ce2471a287b1f9aa3e3e6d3ef91f75bb19a70429","observation_id":"b9c96fa5-2edf-40a3-b1a4-501bdbc90c3b","resolution":{"observed_at":"2026-08-06T15:57:25.119522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T15:57:22.591196Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.591196Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:4bdf1a7e66bd9df6acec44389da43d5ce86ee5221476b2959c642457b18a71e3","observation_id":"0fabef11-8d8b-4b56-867a-9e69465e9f56","resolution":{"observed_at":"2026-08-06T15:57:22.591196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.916004Z","title":"Fastpitch: Parallel text-to-speech with pitch prediction,","venue":null,"work_id":"d685a8d8-e0eb-4b99-a8e6-bd19aa7189af","year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.641193Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:bf19b46b604fafa698cfc1a043477ffd09eee41e340cb81fa7e27cc5a829b210","observation_id":"df94fc8e-f56e-4d3c-b282-fb44fed0ee30","resolution":{"observed_at":"2026-08-06T15:57:24.969094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.788167Z","title":"Tcsinger: Zero-shot singing voice synthesis with style transfer and multi-level style control,","venue":null,"work_id":"22eb46ef-2d2d-45b0-95e1-81eb3145f798","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.706455Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:e1d9f9c9fee81448dda20214c904f9dedf2f9df645efe8af67f15c5ee7a14079","observation_id":"aa4e9205-55d7-43d1-98be-f6f2e64cde40","resolution":{"observed_at":"2026-08-06T15:57:24.822684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.650493Z","title":"Online clustered codebook,","venue":null,"work_id":"bf7577ef-e98a-4c42-8161-296fae690241","year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.774621Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:db1ef4e09bb84747b3a83eae5763723b3701091c7ada9cbec8dc15ddeaf24dad","observation_id":"a45c2ba1-c090-4c1f-98f4-1dabd0e10053","resolution":{"observed_at":"2026-08-06T15:57:24.718540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:22.843384Z","title":"Versatile framework for song generation with prompt-based control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.843384Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:1ab5ec720cf6e44b093c324e8f6c5273f73b3f654b651da00d2763cc780029e3","observation_id":"413b1fd2-3a26-447e-b60c-260114e88022","resolution":{"observed_at":"2026-08-06T15:57:22.843384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.565927Z","title":"Neural discrete representa- tion learning,","venue":null,"work_id":"a035655c-6825-4aea-917e-700bfa4b272e","year":2017},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.872499Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:be663554491e402a6bb209ecf1c69024eec113d7792968ed98a40803d36ba4cc","observation_id":"d6d7515e-12de-4b4a-9708-c365d02980b0","resolution":{"observed_at":"2026-08-06T15:57:24.601983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.432237Z","title":"Stylesinger: Style transfer for out-of-domain singing voice synthesis,","venue":null,"work_id":"8229b8e2-fac2-4c7c-b262-5c6fc60ab9e3","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.907363Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:5d169bd7713eca08daf530131bd777a52f5efb77f183ccbc70a491471327d7ed","observation_id":"192d2527-d4dd-4399-9079-c3b0aa3481c2","resolution":{"observed_at":"2026-08-06T15:57:24.472361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.310082Z","title":"Attention is all you need,","venue":null,"work_id":"914f6afd-1576-4334-a6e5-87cd237f6186","year":2017},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:22.946130Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:b76c0095dcf2d540bf3459718caa4ed3e116a409f6568960632b71717e692674","observation_id":"70e69050-c6de-4617-bf63-2846ad79f51a","resolution":{"observed_at":"2026-08-06T15:57:24.366429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:23.040525Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.040525Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:b3182394e00ce0b9b627fd6168d66c611a3c34c211453b4c516fbe4aa5f079b8","observation_id":"a3c0a13f-26ed-4cf6-8595-a7cfd7a99d5f","resolution":{"observed_at":"2026-08-06T15:57:23.040525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:23.075340Z","title":"Deconvolution and checkerboard artifacts,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.075340Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:2aee1fb32d1d13e1ed42e7d41d910a3d0c127c4e63c93a992931411663d09853","observation_id":"2d7addaf-f07e-44a2-94c2-cd3f7f332b14","resolution":{"observed_at":"2026-08-06T15:57:23.075340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:23.098616Z","title":"Least squares generative adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.098616Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:058bb38a2fe60ca8839d75a9996a8cf55229310c3f7f51248eb3be34cc5d5327","observation_id":"cc8f04d0-4f09-4b09-b8e2-1ba40b78caf3","resolution":{"observed_at":"2026-08-06T15:57:23.098616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.156270Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":"136bc134-49d8-464f-b7e0-c3580bb5093e","year":2019},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.174327Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:b53f184c09d178a95e9a7ddac16d2b1658cbe6465a59b8ecd5921bb02574a1d1","observation_id":"e00da223-e34f-4250-bffe-f10ee2f37467","resolution":{"observed_at":"2026-08-06T15:57:24.234647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:24.031079Z","title":"Gtsinger: A global multi-technique singing corpus with realistic music scores for all singing tasks,","venue":null,"work_id":"86d6ce57-162e-4465-bddf-d454fb7d9e1e","year":2024},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.233471Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:c2991c2340fa5da2da1bef3d7b14fbcbd4cf834c60f58b18852e9547177b4bd8","observation_id":"29c8e372-8a71-449e-84b6-078ce53fbe70","resolution":{"observed_at":"2026-08-06T15:57:24.096294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:23.926108Z","title":"Any-to-any generation via composable diffusion,","venue":null,"work_id":"962f2916-bc90-46af-919f-ececb1aa1b2d","year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.261921Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:feabc71a5f7dde055c29027f9af6bfede1803e140bd16dd3093c5d49d86be70a","observation_id":"8969748c-db12-4245-bde3-787651920458","resolution":{"observed_at":"2026-08-06T15:57:23.957767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:57:23.295591Z","title":"Any-to-many voice conversion with location-relative sequence-to-sequence modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.295591Z"},"links":{"citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:c5c41bb8b7839f4d3ea696c8e917a2226482b32f13500f45a42f762520e06df6","observation_id":"4fa7bbd9-077c-481f-a3e6-0f43e14ac6e6","resolution":{"observed_at":"2026-08-06T15:57:23.295591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08296","last_updated":"2023-02-23T05:43:07Z","snapshot_observed_at":"2026-08-06T20:00:24.837125Z","submitted_at":"2023-02-16T13:49:09Z","title":"QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion","version":4},"cited_work":{"arxiv_id":"2302.08296","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.08296","snapshot_observed_at":"2026-08-06T15:57:23.455348Z","title":"QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion","venue":"cs.SD","work_id":"9e96189d-9f9e-4382-8fb9-620f5e2c972b","year":2023},"citing_paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:23.386903Z"},"links":{"cited_paper":"/paper/2302.08296","citing_paper":"/paper/2507.14534"},"observation_digest":"sha256:820ca4b2a20887038896aefe11c646692166ca4a168174d3c97c108169dc8495","observation_id":"5a24e83c-6473-4627-860b-cd2028b88c1c","resolution":{"observed_at":"2026-08-06T15:57:23.502029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14534","last_updated":"2025-08-30T16:35:05Z","latest_version":4,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:08:16.949133Z","submitted_at":"2025-07-19T08:32:07Z","title":"Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2507.14534."}