{"as_of":"2026-08-06T17:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb3c3d939d4d7b53ab82ad374dbbe37261319baf25a3c7a07edc0e57b7471ca7","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T11:35:58.050305Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:00:27.852836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18094","snapshot_observed_at":"2026-08-03T18:00:27.852836Z","title":"Onevoice: One model, triple scenarios-towards unified zero-shot voice con- version,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2512.07352","last_updated":"2026-06-09T12:53:03Z","snapshot_observed_at":"2026-08-04T12:59:20.361467Z","submitted_at":"2025-12-08T09:43:30Z","title":"MultiAPI Spoof: A Multi-API Dataset and Local-Attention Network for Speech Anti-spoofing Detection","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:00:27.852836Z"},"links":{"cited_paper":"/paper/2601.18094","citing_paper":"/paper/2512.07352"},"observation_digest":"sha256:759d037ae5babd2fdcdd5009b3adb2d611f3a32e11e03df29382089e1dd46d52","observation_id":"a47df495-4001-4464-829e-102a64b06aad","resolution":{"observed_at":"2026-08-03T18:00:27.852836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.18094/citation-record","integrity":"/paper/2601.18094/integrity","json":"/paper/2601.18094/citation-record.json","paper":"/paper/2601.18094"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming voice con- version via intermediate bottleneck features and non- streaming teacher guidance","venue":null,"work_id":"92f067c3-354e-4b9c-9141-32c233b0eeef","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:5f2b9a51f9b7951353cff82331ef1c129e186adf491c9cec615ee83db6c38580","observation_id":"19c87387-2e29-4079-8009-eae1873d6d4a","resolution":{"observed_at":"2026-05-22T11:36:29.271534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yingmusic-svc: Real- world robust zero-shot singing voice conversion with flow- grpo and singing-specific inductive biases.Arxiv","venue":null,"work_id":"facb3a0d-43cd-4ce3-99e2-5d39d6f81a19","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:a5245102c6ee373160fb329a74c55216e9203508c1bce7f1b97515b1089f7212","observation_id":"91d816af-a723-4002-afea-6fabc1640502","resolution":{"observed_at":"2026-05-22T11:36:29.178893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural analysis and synthesis: Reconstructing speech from self-supervised representations","venue":null,"work_id":"4d5bfcf0-77ab-4104-8ff2-128b986618c2","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:e0927f2e3bb32713a3e19a6594d4e2164fa65ba004dc776e20d0b81f7a4ce1e2","observation_id":"9f190ef8-61d3-433d-a157-c20f0831b08c","resolution":{"observed_at":"2026-05-22T11:36:29.290104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"60042596-8eec-4d6b-a53f-6318caae1b8f","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:df89b513ab1dfa62ae0cc2f869a9d0263ea0d06d1165245717390732dbed98d6","observation_id":"8b30aaee-f30f-4754-8ea4-0e9033182326","resolution":{"observed_at":"2026-05-22T11:36:29.217619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The nus sung and spoken lyrics corpus: A quantitative comparison of singing and speech","venue":null,"work_id":"224fc78e-1acf-4857-a424-fdc28afcfa49","year":2013},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:f917c3b7ce99e2dc560cc952f7131e191aeb271b6b43caaedc3226ff3f3bd18a","observation_id":"b498b656-2ec5-4a15-ad9b-f63a3b024ab6","resolution":{"observed_at":"2026-05-22T11:36:29.202283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":"2f5e28e5-b6ac-463d-9767-f14a86c30943","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:70d9d844448d9b10d04ec6153c516080db251bbae853b621a26748b7818078a0","observation_id":"88d8c067-597a-447c-85a9-736238fd5692","resolution":{"observed_at":"2026-05-22T11:36:29.278134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transformers: scaling to trillion parame- ter models with simple and efficient sparsity.Journal of Machine Learning Research, 23","venue":null,"work_id":"de72340e-d972-4e04-94ab-4b489b60e63e","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9fbdca1819d6f8cfedd9db0260a1f9f2a5cc70fb2b140ce365c89c247efa6463","observation_id":"5bb3d4b0-ccc1-4000-b6cb-903dd435bc0f","resolution":{"observed_at":"2026-05-22T11:36:29.298051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zico Kolter, and Kaiming He","venue":null,"work_id":"19e541e9-ee16-4ba7-82f0-94805e08baaf","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:853b4504b01716fd440cea3b658a64ffa6175bfeda01b32ac77c958db7752b8e","observation_id":"3998f120-7296-481b-9081-a875bb7c3e99","resolution":{"observed_at":"2026-05-22T11:36:29.195657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bigvgan: A universal neural vocoder with large-scale training.Arxiv","venue":null,"work_id":"0e16d298-26a4-4d85-95a3-29f28ab6c15b","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:16118a936c741119af436f51e8f9f54ba66ae72d30716f929aa5c700eeadc8e5","observation_id":"f88b34bf-2489-41e1-aa3f-91ed6ca779bc","resolution":{"observed_at":"2026-05-22T11:36:29.188972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emilia: A large-scale, extensive, multilingual, and diverse dataset for speech generation.Transactions on Audio, Speech and Language Processing, 33:4044–4054","venue":null,"work_id":"99e09c0e-a202-4de3-b274-1b10f58cddb8","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:2c74623b3cb7076840c0be7772bab5bfaacf02ee49dacb5f89c4c466e5c05e86","observation_id":"297ec85a-436d-4898-8281-49a3721bcb25","resolution":{"observed_at":"2026-05-22T11:36:29.185821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HuBERT: Self- supervised speech representation learning by masked pre- diction of hidden units.Transactions on Audio, Speech, and Language Processing, 29:3451–3460","venue":null,"work_id":"77902bf4-13b1-42ff-bef8-aff85f9857fa","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:2e9d49e15d16d7296556c81ac5f881c5487bbbbe4bfc07e3a933f5ffb4f777a2","observation_id":"1c320591-e7cc-4d2c-b6c1-cc75f5a69cc1","resolution":{"observed_at":"2026-05-22T11:36:29.205561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"d76efb99-5393-4e2a-b11f-80fef89e80fb","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:007276c965bf7019b084df9c8ba3155fcc4cb57797e38322a5e620e3dddf6e3a","observation_id":"cfecea9d-92bc-453f-9db6-89d94ecbdf42","resolution":{"observed_at":"2026-05-22T11:36:29.192479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-singer: Fast multi-singer singing voice vocoder with a large-scale corpus","venue":null,"work_id":"d51b05fb-30ae-489e-9d4b-570f1fca3fd0","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:e3357510d026fcb1df2d3cc8552b6d569eb9df73b89236581a1cac1b06635349","observation_id":"29be1a8e-c65e-4da5-9f2c-aa131a215253","resolution":{"observed_at":"2026-05-22T11:36:29.232832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The singing voice conversion challenge","venue":null,"work_id":"36e6720f-eadc-442f-8a2e-9241ef1a5df1","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:644e038717bc37e11fd5149d155d7bb3f1eb23b8da48a91548d0433b974e0a2b","observation_id":"70f90b48-c7f0-4bf2-b541-b2e68a123495","resolution":{"observed_at":"2026-05-22T11:36:29.268487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiTAR: Diffusion transformer autoregressive modeling for speech generation","venue":null,"work_id":"59dda2c0-de01-4e74-9ab7-410a4f4d49f4","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:28454101981fe2fb2da3bae53e19b0d716d08ee644a40147c9a3c5cc6361e490","observation_id":"87851fa9-cddf-444d-b4b4-bf994d401481","resolution":{"observed_at":"2026-05-22T11:36:29.199239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ref-vc: Robust, expressive and fast zero-shot voice conversion with diffusion trans- formers.Arxiv","venue":null,"work_id":"b4bbd389-31eb-4c85-9c70-664ed943984e","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:402d3afc0e52cdf019ad3279b8fb0e732bef32d49f7c45fb8aa9b26e0689a97c","observation_id":"227dce47-46fc-4752-9625-517637dab163","resolution":{"observed_at":"2026-05-22T11:36:29.214582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion mod- els","venue":null,"work_id":"62518d9e-8622-4fea-90da-b8eed9bb21cf","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:63c157bdbe374a4ca6833734649dde5045ba76a5cb467f93338279930b80d069","observation_id":"31ad7fda-1618-49d6-903c-3f66cefd5260","resolution":{"observed_at":"2026-05-22T11:36:29.262253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient multilingual asr finetuning via lora language ex- perts","venue":null,"work_id":"4e347368-be00-443a-9ab5-0d472cd6968f","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:39f9f138bfb5eddcbb7313822a77e1e4960951b09d2ae91d25306332fcf2c392","observation_id":"88103a3d-4d45-4173-840b-2f6a1c657f1b","resolution":{"observed_at":"2026-05-22T11:36:29.249541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ded35e4b-a926-43be-a168-1461c158f03b","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:af8e59a82965e7f44fce9fdc105f3abec52d61a24904e840252066c7c51a7da8","observation_id":"48720ead-b5b8-4888-93f9-7e690c4a353e","resolution":{"observed_at":"2026-05-22T11:36:29.211144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transferring source style in non-parallel voice conversion","venue":null,"work_id":"24904abb-78d7-40e6-a3fd-b2fa31b73189","year":2020},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9399486f63d82435ed02fd74bcdc9f0440e819423fd728f8479368dbad4308b3","observation_id":"8db6212e-b3fc-4c1b-9f32-357467838f71","resolution":{"observed_at":"2026-05-22T11:36:29.208336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the beauty in songs: Neural singing voice beautifier","venue":null,"work_id":"5e9ef4fb-c518-48f8-b14d-9a25ee89ed11","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:d1895c24a6f6a14973232e168b22a7cefe6993e9d803f7a63e729c1aed1f3c45","observation_id":"481fda3a-022a-4a31-a607-7f7d42905c77","resolution":{"observed_at":"2026-05-22T11:36:29.182168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot voice conversion with diffusion transformers.Arxiv","venue":null,"work_id":"a3a69550-c8a4-4789-9e05-25811c50414d","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:4bfa1fdde1b1933e241d7f4ce721fc190588af86c5d8d0af05e2dfc13718f319","observation_id":"45127fd4-855c-48d2-8891-cb7ac3ec736e","resolution":{"observed_at":"2026-05-22T11:36:29.258872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hdmole: Mixture of lora experts with hi- erarchical routing and dynamic thresholds for fine-tuning llm-based asr models","venue":null,"work_id":"041cb7fd-e6c5-4b03-b2d2-b34094fdde2f","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:be1e591c4703e9e5f3e4a050287ca9f68ab111ad992b2ce0a1ccebf4bf7adec1","observation_id":"bd7e4782-d2d0-47c4-8dfd-529a7a296c17","resolution":{"observed_at":"2026-05-22T11:36:29.255874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers.Arxiv","venue":null,"work_id":"9aa01481-f236-49b0-bc64-a82fa24b8974","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:0bf31189917f4c066d4e22cdd77d633c4176b59a27e3be23ddfde3b5953be210","observation_id":"5dc1f525-bcf4-4776-991a-63a43de8933a","resolution":{"observed_at":"2026-05-22T11:36:29.242735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vibevoice technical report.Arxiv","venue":null,"work_id":"9b5092b8-32ca-461c-bb4a-81601b102336","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:4e9cbdce967e0014dd209e3138e6da5646c0191d16a0e7f82237b751e1f3ad0b","observation_id":"2b7133db-176d-4531-8ea3-5d03cfea5c38","resolution":{"observed_at":"2026-05-22T11:36:29.229863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"a56d4c9f-f548-4c94-a15e-929ff363fe3e","year":2017},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:8c22b1977c14dcb0e660fe8638ecaa708992aa24ca4be33fa8e8628f18f464ff","observation_id":"b0e87392-298a-4c8b-b905-679510ad55c8","resolution":{"observed_at":"2026-05-22T11:36:29.265309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singing voice data scaling-up: An intro- duction to ace-opencpop and ace-kising.Arxiv","venue":null,"work_id":"ed32b55f-c7b7-495d-9694-cf1c0e0ca5dc","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:89cdf8c592131897d3826b835cbb41dacd86b1aab21c702eb050a2280c9481d5","observation_id":"e6c60e03-6bee-4aef-86bb-5d839e6f9ab2","resolution":{"observed_at":"2026-05-22T11:36:29.294575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Li, Hao Wang, Shiyin Kang, and H","venue":null,"work_id":"5e81dfc1-7496-47ae-810d-e1e5406de3f0","year":2016},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:8a5c1b083c1da8de761dd097af4c9be97f7190c2a85434d7144a4c36cd671456","observation_id":"6d6c033f-3228-4f13-b64a-ff0bd6371b28","resolution":{"observed_at":"2026-05-22T11:36:29.235876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal latent language modeling with next-token diffusion.Arxiv","venue":null,"work_id":"1d82cfbd-b7c5-4f01-bca9-957c6c5751fc","year":2024},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:e2c14a2259738ccee9f426540ca3d6e15c80e42e11bf434b75bea13fa099803a","observation_id":"d3d40483-91aa-4c07-b1a5-855490497f68","resolution":{"observed_at":"2026-05-22T11:36:29.287788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencpop: A high-quality open source chinese popular song corpus for singing voice synthesis.Arxiv","venue":null,"work_id":"04b4967a-1c75-499a-8035-3a197ac79ab3","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:26d0eaf70c3f156514911f9b7e20d2c88e2f4595e7b74420c68691b849c5e842","observation_id":"867c0439-611b-47dd-ae25-1ad9952d47dd","resolution":{"observed_at":"2026-05-22T11:36:29.239273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metis: A foundation speech generation model with masked generative pre-training.Arxiv","venue":null,"work_id":"dd672889-eb15-4c9e-af0f-0c1992562c57","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:fedcbcdc7dec782742b4567f63f0043bbb3c4985ccf8b83e3d6b179a3cf3f739","observation_id":"32192538-672b-41e9-b944-09775968a27b","resolution":{"observed_at":"2026-05-22T11:36:29.246299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moe-tts: Enhancing out-of-domain text understanding for description-based tts via mixture-of-experts.Arxiv","venue":null,"work_id":"d47363bf-81e5-408e-8404-67521664879d","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:f97e7d83a08ddf8dca24f59d068cd2a167082a6c4b904435db1d98ae9e031615","observation_id":"74b166b9-f8bb-4336-9097-cb386f322334","resolution":{"observed_at":"2026-05-22T11:36:29.252744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniaudio: An audio foundation model to- ward universal audio generation","venue":null,"work_id":"823925eb-e607-4946-af27-df8a003bd131","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:061a84e9bb22c8739c4df5e76ecd977599534ce25a4fc62aa032a985df702cb8","observation_id":"d61cd101-c106-486f-b5f5-cbcdb990159a","resolution":{"observed_at":"2026-05-22T11:36:29.284992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llasa: Scal- ing train-time and inference-time compute for llama-based speech synthesis.Arxiv","venue":null,"work_id":"be6bf6d3-c434-43a4-9591-c261b37b7dbb","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:941a84fc99756a47e4b08b053324c73925ba95ea9460da2a3a0eab6977399149","observation_id":"48d0ee07-9e78-4e2c-88c5-b5cb466be1ab","resolution":{"observed_at":"2026-05-22T11:36:29.281589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megabyte: Predicting million-byte sequences with multi- scale transformers","venue":null,"work_id":"19fd14a1-aa86-401c-a118-ad633553cacc","year":2023},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:36ba756f420e59f979a50c60d4486a8d8f1a8b1ba3b333ea129f560df7f1c669","observation_id":"802ef9e6-633e-41de-9018-be6165b51762","resolution":{"observed_at":"2026-05-22T11:36:29.223750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Takin-VC: Expressive zero-shot voice conversion via adaptive hybrid content encoding and en- hanced timbre modeling","venue":null,"work_id":"89eabc2c-e32d-4901-9a61-967fc3270da9","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:ba5e257f49d8673af703aa7e1141c2bb6b5e0054a37bdff8c22c96ea55f0a5a8","observation_id":"7fc96d1b-709d-462f-9f00-d01719115e12","resolution":{"observed_at":"2026-05-22T11:36:29.292338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SoundStream: An end-to-end neural audio codec.Trans- actions on Audio, Speech, and Language Processing, 30:495–507","venue":null,"work_id":"0adf41e9-091e-4db3-952e-67daac9b4e92","year":2021},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:9b9f88cc73b4a8bb2d2f6d55b58993f69c24662c5d2e8558ce64ba7c51721eee","observation_id":"6c6efad3-e0fc-4932-8e3c-7e772ddf3c82","resolution":{"observed_at":"2026-05-22T11:36:29.226774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M4singer: A multi-style, multi-singer and musical score provided mandarin singing corpus","venue":null,"work_id":"cf85f948-05ad-4d58-b299-3d3a1f22a5cf","year":2022},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:60ae3ec6fabc997ff001ac2fc6583424d3874a80d94c4b6effc0231de9e5be90","observation_id":"3f3a50f3-1873-4b26-8585-e27c36a65171","resolution":{"observed_at":"2026-05-22T11:36:29.220666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":"ae9939c3-4abf-4b7b-98e4-ed63840f1f04","year":2025},"citing_paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T11:35:58.050305Z"},"links":{"citing_paper":"/paper/2601.18094"},"observation_digest":"sha256:1e797bb1d83baba70543165805df920043d372753fcc21de811882f39aa2b919","observation_id":"ece65de7-8748-4a7a-8970-0fc1230d80fc","resolution":{"observed_at":"2026-05-22T11:36:29.274768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.18094","last_updated":"2026-05-21T07:34:45Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T13:38:41.751748Z","submitted_at":"2026-01-26T03:11:56Z","title":"OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2601.18094."}