{"as_of":"2026-08-10T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c7f4073910b7308ccf3ffb0ba6a412e2ecfbb777956cb46d69d644d6c0d98a5","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:56.553076Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08348/citation-record","integrity":"/paper/2506.08348/integrity","json":"/paper/2506.08348/citation-record.json","paper":"/paper/2506.08348"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.208254Z","title":"V oice conversion based on maximum-likelihood estimation of spectral parameter trajectory,","venue":null,"work_id":"62018eaf-bfa2-4679-9ae8-0ef42a2c8bba","year":2007},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.349680Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:2da24d4e274742fc5ec4fb76a6079859b3f535823bc4e494f6dde7dde6ec3449","observation_id":"984f4d4e-e765-4b3e-bddd-41082157cc25","resolution":{"observed_at":"2026-08-07T05:20:57.213088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.191546Z","title":"V oice conver- sion using partial least squares regression,","venue":null,"work_id":"30fa58bf-4dc6-4310-91c1-96d4ed52c91c","year":2010},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.355241Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:190d52be6501cb28c3ac3090d08c21b91ad5c74a22b28cbc80cc502e3b433755","observation_id":"054c55bf-929c-4d75-9be2-50d73c02b065","resolution":{"observed_at":"2026-08-07T05:20:57.197580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.175202Z","title":"One-shot voice conversion by vector quan- tization,","venue":null,"work_id":"e04d2721-d499-4aa0-b2a1-d87d87b40fcf","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.360386Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:e65e08c184e78c38f5b804f7d870bfaaf8747d06c9631e0d7740a166b5a2ae47","observation_id":"48862db6-524c-441e-b0b7-e5c886434783","resolution":{"observed_at":"2026-08-07T05:20:57.180600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.159001Z","title":"V oice conversion based on weighted frequency warping,","venue":null,"work_id":"2f613076-fca9-47e7-8272-faf42962a7bc","year":2009},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.365278Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:49bed4ca9bc09aadb243469f365b366850f6fa5fa6845f610deb4c67df2a854d","observation_id":"0aaf1b13-36fa-458c-9b41-7c18fcc01b62","resolution":{"observed_at":"2026-08-07T05:20:57.163946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.143867Z","title":"Exemplar-based emotional voice conversion using non-negative matrix factorization,","venue":null,"work_id":"eae99c0f-ad12-455e-8cd0-59583b011047","year":2014},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.370718Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:cc84a2f0073aa617da7504652a3307253123680b62b710bb6d570b7b7f1bbdd5","observation_id":"7dd43c19-8577-43fc-bbfb-7186634612d4","resolution":{"observed_at":"2026-08-07T05:20:57.148796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11672","last_updated":"2020-10-22T13:08:44Z","snapshot_observed_at":"2026-08-08T14:16:06.750518Z","submitted_at":"2020-10-22T13:08:44Z","title":"CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-spectrogram Conversion","version":1},"cited_work":{"arxiv_id":"2010.11672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11672","snapshot_observed_at":"2026-08-07T05:20:56.868423Z","title":"CycleGAN-VC3: Examining and Improving CycleGAN-VCs for Mel-spectrogram Conversion","venue":"cs.SD","work_id":"bca0b3fb-306f-4916-9469-56cd836f3a1d","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.376682Z"},"links":{"cited_paper":"/paper/2010.11672","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:cb5fd7d06abdc99be2cd2a333081b2c340e2a73e5c24da365a01f8946efaf73b","observation_id":"da33dfc8-5ad9-48d6-9fee-b5b8abee40f6","resolution":{"observed_at":"2026-08-07T05:20:56.874154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.127351Z","title":"Maskcyclegan-vc: Learning non-parallel voice conversion with filling in frames,","venue":null,"work_id":"e11c7c68-bd05-4809-a4f0-f475a272576d","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.382682Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:979eccfa5d8695a82695c362068eb69b74dca44ba1515a72c7ce10a6bd7e4016","observation_id":"99f28df6-a2f3-472d-a176-31048a0dd276","resolution":{"observed_at":"2026-08-07T05:20:57.132574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.112268Z","title":"Stargan-vc: Non- parallel many-to-many voice conversion using star generative adversarial networks,","venue":null,"work_id":"74aebe66-c889-412d-9821-24cc7c2317d1","year":2018},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.387162Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a108b98f6733717e7ac8f5fe58bff5ce71de07922fcfd8c9093454b5b435b568","observation_id":"9d67a24d-2905-4074-ab9a-045b33805422","resolution":{"observed_at":"2026-08-07T05:20:57.117039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12279","last_updated":"2019-08-07T10:21:30Z","snapshot_observed_at":"2026-07-06T08:10:51.630781Z","submitted_at":"2019-07-29T08:51:52Z","title":"StarGAN-VC2: Rethinking Conditional Methods for StarGAN-Based Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12279","snapshot_observed_at":"2026-08-07T05:20:56.392760Z","title":"Stargan-vc2: Rethinking conditional methods for stargan-based voice conversion,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.392760Z"},"links":{"cited_paper":"/paper/1907.12279","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:6f182275a10067b8897d5cc129f29f456527d73aadd7f7bc7c1ff8c9f7966c05","observation_id":"4fd6335c-3a3c-4aa9-a103-f53bfce22d4e","resolution":{"observed_at":"2026-08-07T05:20:56.392760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10394","last_updated":"2021-07-23T01:08:09Z","snapshot_observed_at":"2026-07-06T11:31:23.057674Z","submitted_at":"2021-07-21T23:44:17Z","title":"StarGANv2-VC: A Diverse, Unsupervised, Non-parallel Framework for Natural-Sounding Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10394","snapshot_observed_at":"2026-08-07T05:20:56.397656Z","title":"Starganv2-vc: A diverse, unsuper- vised, non-parallel framework for natural-sounding voice conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.397656Z"},"links":{"cited_paper":"/paper/2107.10394","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:9ea4180e899bdff67ff402e24a5b14d41f4f1caf19633fde48821201ba6dd08a","observation_id":"d4189bac-1350-46ff-b3c3-a060f636ea3f","resolution":{"observed_at":"2026-08-07T05:20:56.397656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.097061Z","title":"Towards low-resource stargan voice conversion using weight adaptive instance normalization,","venue":null,"work_id":"c0eeae04-86f0-4fb0-991f-478f8637a266","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.402598Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:572f8c78fa19ae63d22719c78333aba3bfc6cee53d59799a4aa8960e9376c8a5","observation_id":"a4ce5873-37db-4adb-91f5-c3925145d518","resolution":{"observed_at":"2026-08-07T05:20:57.102161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.407074Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.407074Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:db6bbb43685323e7118532c1bc3200039eb2f5bc3e047400877c36b9c0b36fb1","observation_id":"95a0c7a2-16a0-43e5-8868-16dd187b3eeb","resolution":{"observed_at":"2026-08-07T05:20:56.407074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.412130Z","title":"Analyzing and improving the image quality of stylegan,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.412130Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:20396732d8ea388a3b17e85aa48cd5772b8c6ebe1000b15e6324e9a768ed3955","observation_id":"10f13ce0-a278-4900-bacc-a351945f680b","resolution":{"observed_at":"2026-08-07T05:20:56.412130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.059173Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"7c50c522-5428-4a85-a768-cacf723e327c","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.416818Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:aa82e05d697666edfb8c4cf73d9fbf921d2ba14d82531765ef693311c370fdc6","observation_id":"34ddbf14-51fb-4147-9c04-1ad48ea6fac2","resolution":{"observed_at":"2026-08-07T05:20:57.065026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.421720Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.421720Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:756891c1017e47610bd2f6e037ca31b1a2d220c239b1559ce1e6a132db90c56e","observation_id":"a7b46ca5-8135-40cc-bd41-a523363454e1","resolution":{"observed_at":"2026-08-07T05:20:56.421720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18975","last_updated":"2023-05-30T12:19:07Z","snapshot_observed_at":"2026-07-06T15:35:22.185803Z","submitted_at":"2023-05-30T12:19:07Z","title":"Voice Conversion With Just Nearest Neighbors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18975","snapshot_observed_at":"2026-08-07T05:20:56.427227Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.427227Z"},"links":{"cited_paper":"/paper/2305.18975","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:75a80cddddcd88111821ae5f381aa79a393eb10f93868e204d7af88606d684b4","observation_id":"2cec32e6-62f1-4393-ba0b-46bceb591cd6","resolution":{"observed_at":"2026-08-07T05:20:56.427227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.432228Z","title":"Unsupervised speech decomposition via triple information bottleneck,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.432228Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:584413d40b17c53c06802ea38b6cacee3d04fc39f3da303766e631613dc15b06","observation_id":"08562dc7-af3a-4d64-b812-abe8067c4944","resolution":{"observed_at":"2026-08-07T05:20:56.432228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:57.021504Z","title":"Speech- split2. 0: Unsupervised speech disentanglement for voice conversion without tuning autoencoder bottlenecks,","venue":null,"work_id":"df7bab6a-cfc4-43a7-b947-f9b84e3b87c9","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.436825Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:690872b24e99165e9bb18b13ebc0d1eb3d978fcaf16753f20853814f796f0546","observation_id":"51267e6b-de04-4351-b386-8eac3f0f5689","resolution":{"observed_at":"2026-08-07T05:20:57.026704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05742","last_updated":"2019-08-22T17:18:16Z","snapshot_observed_at":"2026-07-06T07:45:28.742612Z","submitted_at":"2019-04-10T16:22:18Z","title":"One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05742","snapshot_observed_at":"2026-08-07T05:20:56.441589Z","title":"One-shot voice conversion by separating speaker and content representations with instance normaliza- tion,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.441589Z"},"links":{"cited_paper":"/paper/1904.05742","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:2db71ae14c3fda3274122ff5bfce592d8107424232918ffd790fdfb100cdc683","observation_id":"d4206615-b39a-45e5-96a6-7b9b54315815","resolution":{"observed_at":"2026-08-07T05:20:56.441589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.446819Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.446819Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:730d67d11086d5cea601b445054f8e4adcb6aec197bf72b16c7e03ec9d4a5ff3","observation_id":"389d9cb2-3bb7-4c5f-9f84-436da54614bb","resolution":{"observed_at":"2026-08-07T05:20:56.446819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T05:20:56.451555Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.451555Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:4d68dfc60b5509e8fb81461d3e59583549a008f0df44be5412c93041ba99f929","observation_id":"9d099ae3-f46a-4463-bb50-feaf6ed86116","resolution":{"observed_at":"2026-08-07T05:20:56.451555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T05:20:56.456677Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.456677Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:57b2c3a7ddb4feecdcd0e5402fa77bd598fbce952d7e2ff061804110398b470d","observation_id":"9d9b5c92-6c73-4621-bdb8-6ffb89b708d1","resolution":{"observed_at":"2026-08-07T05:20:56.456677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-07T05:20:56.462348Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.462348Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a1df6c41a9b33424774b16225ae623d0850730e02b5b04f30254288b6d134c0f","observation_id":"2ddd568e-09ad-4df4-bd24-95be75ee1743","resolution":{"observed_at":"2026-08-07T05:20:56.462348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17746","last_updated":"2024-09-26T11:22:16Z","snapshot_observed_at":"2026-07-06T19:22:41.483499Z","submitted_at":"2024-09-26T11:22:16Z","title":"Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17746","snapshot_observed_at":"2026-08-07T05:20:56.467464Z","title":"Paraformer-v2: An improved non- autoregressive transformer for noise-robust speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.467464Z"},"links":{"cited_paper":"/paper/2409.17746","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:feffef0a2b98974bb9abefa9c72d88cdc6378a328699938c524aa1cfa0ebbc78","observation_id":"f57e56ba-f70a-43e0-83c3-5c082c7d1716","resolution":{"observed_at":"2026-08-07T05:20:56.467464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15249","last_updated":"2022-11-11T02:51:15Z","snapshot_observed_at":"2026-07-06T12:53:57.562834Z","submitted_at":"2022-03-29T05:48:24Z","title":"MFA-Conformer: Multi-scale Feature Aggregation Conformer for Automatic Speaker Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15249","snapshot_observed_at":"2026-08-07T05:20:56.473419Z","title":"Mfa-conformer: Multi-scale feature aggregation conformer for automatic speaker verification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.473419Z"},"links":{"cited_paper":"/paper/2203.15249","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:831ebdf8cdad5c0989adfc3c2e3fde72b2e1d1fef20819622c8d88d9fb916a8d","observation_id":"1bbcee2d-6004-41b3-86a1-47a1d2b5ebb3","resolution":{"observed_at":"2026-08-07T05:20:56.473419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.994036Z","title":"Mfa: Tdnn with multi- scale frequency-channel attention for text-independent speaker verifi- cation with short utterances,","venue":null,"work_id":"1b982175-c247-4c07-9afd-bb0382b417c9","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.478268Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:fda3243c3c4bed050e62f05d770407672b79116a92b4be8b78e534f8057fa45f","observation_id":"324d17f9-1a2f-48b8-a9b8-0a889100a81f","resolution":{"observed_at":"2026-08-07T05:20:57.000084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.977303Z","title":"Se-conformer: Time-domain speech enhancement using conformer","venue":null,"work_id":"6d3ffe19-1323-4464-80ae-1c153832f723","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.482746Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:706a567387c51781c1eb885f594b32d2c5d819aba7622faa33c2fed82734ec10","observation_id":"97c410a0-8548-4920-b604-8548fbbec478","resolution":{"observed_at":"2026-08-07T05:20:56.982325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.960467Z","title":"Cmgan: Conformer-based metric- gan for monaural speech enhancement,","venue":null,"work_id":"e1a56fa7-8ec3-45f0-a9ea-7e1154fc26e4","year":2024},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.487609Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:82e1e94d06b4757c7da132105f7ca4235b7d817f2c28a6234208d0388e54fbba","observation_id":"20ec24b6-256f-4d1e-a607-066b63aa2c4a","resolution":{"observed_at":"2026-08-07T05:20:56.966249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07737","last_updated":"2017-11-21T15:35:07Z","snapshot_observed_at":"2026-08-04T09:19:45.912586Z","submitted_at":"2017-03-22T16:34:29Z","title":"In Defense of the Triplet Loss for Person Re-Identification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07737","snapshot_observed_at":"2026-08-07T05:20:56.493364Z","title":"In defense of the triplet loss for person re-identification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.493364Z"},"links":{"cited_paper":"/paper/1703.07737","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:68ddf2346bb9c07611a6d26027fbc794b2254be0b45d1300c8b9ae95450ba654","observation_id":"e95fdbee-caad-4a3b-8b2b-630d24ef99ea","resolution":{"observed_at":"2026-08-07T05:20:56.493364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00930","last_updated":"2024-11-24T09:30:29Z","snapshot_observed_at":"2026-08-09T14:30:22.810368Z","submitted_at":"2024-05-02T01:11:15Z","title":"MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion","version":2},"cited_work":{"arxiv_id":"2405.00930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.00930","snapshot_observed_at":"2026-08-07T05:20:56.696846Z","title":"MAIN-VC: Lightweight Speech Representation Disentanglement for One-shot Voice Conversion","venue":"cs.SD","work_id":"9ac34d8a-6639-416f-992b-1129eb8d4615","year":2024},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.497984Z"},"links":{"cited_paper":"/paper/2405.00930","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:8fd917eff444636b51e42e955e442456a3e13fd905e656537f67586480ee36a8","observation_id":"6b72c4ae-d7bf-413b-a6e0-f593f4477a1e","resolution":{"observed_at":"2026-08-07T05:20:56.702013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.944371Z","title":"knn-svc: Robust zero- shot singing voice conversion with additive synthesis and concatenation smoothness optimization,","venue":null,"work_id":"326152db-22c6-42d8-82a2-1e96714112c5","year":2025},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.503106Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:d2ccbb09474c1d7e5931adfb7e97b87b6bd4f7848e2bb98616ccd48f9f98e53d","observation_id":"1098f1f7-edd4-441d-ad11-d24b9d113d07","resolution":{"observed_at":"2026-08-07T05:20:56.949262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.926686Z","title":"A new spoken language teaching tech: Combining multi-attention and adain for one-shot cross language voice conversion,","venue":null,"work_id":"74f642fa-a906-4328-a351-4bc988a90f47","year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.507605Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:dc8b816bc975a968d206180f2f43a30b9505f84a75590ece13b427d209b5355c","observation_id":"9aa6b093-a4b5-4fd5-a3b1-b94c5a44c3e8","resolution":{"observed_at":"2026-08-07T05:20:56.932215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.910189Z","title":"Styleformer: Real-time arbitrary style transfer via parametric style composition,","venue":null,"work_id":"55dc93e9-d48a-45bd-9090-f1ef27604f83","year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.512525Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a54abe875fb4c0b0071d3f9d13250f3588906d53bfa83b534091f4f4576fc37d","observation_id":"a7c9e42c-6d60-4c8c-90ec-947758a786a0","resolution":{"observed_at":"2026-08-07T05:20:56.915323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.517160Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.517160Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:2651fed6fdc5f36f9f2380fadca8365dfae39ab72e2fe2c3a1568f6abbb62cc2","observation_id":"4f89271c-c861-4aa6-a42e-2758c06cb6a9","resolution":{"observed_at":"2026-08-07T05:20:56.517160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12585","last_updated":"2020-06-01T01:17:18Z","snapshot_observed_at":"2026-08-06T02:38:07.962906Z","submitted_at":"2020-04-27T05:20:01Z","title":"A Batch Normalized Inference Network Keeps the KL Vanishing Away","version":2},"cited_work":{"arxiv_id":"2004.12585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.12585","snapshot_observed_at":"2026-08-07T05:20:56.676168Z","title":"A Batch Normalized Inference Network Keeps the KL Vanishing Away","venue":"cs.LG","work_id":"3e7830a8-e472-4875-b30b-0f422485ee5e","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.521996Z"},"links":{"cited_paper":"/paper/2004.12585","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:0b16ddd9e45a12565a747fcc16db6a8838ac4f31f900c76c62ea5ac1de5fe0a8","observation_id":"75ac5187-8e31-46cb-a028-a4a91e253f5d","resolution":{"observed_at":"2026-08-07T05:20:56.681323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:56.884923Z","title":"Weight normalization: A simple repa- rameterization to accelerate training of deep neural networks,","venue":null,"work_id":"251b1baf-9494-4301-a74a-f715014194f0","year":2016},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.526933Z"},"links":{"citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:686e39c95479893368e29a4c3e51183813e56d35f13631ba032acd8d67596425","observation_id":"131ea2c9-9d5d-43a5-a1ef-22a52f3f1cb4","resolution":{"observed_at":"2026-08-07T05:20:56.889796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11929","last_updated":"2020-12-22T11:03:14Z","snapshot_observed_at":"2026-08-08T07:22:07.814370Z","submitted_at":"2020-12-22T11:03:14Z","title":"Full characterization of graphs having certain normalized Laplacian eigenvalue of multiplicity $n-3$","version":1},"cited_work":{"arxiv_id":"2012.11929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.11929","snapshot_observed_at":"2026-08-07T05:20:56.652153Z","title":"Full characterization of graphs having certain normalized Laplacian eigenvalue of multiplicity $n-3$","venue":"math.CO","work_id":"7e26da96-060e-4dc3-bdc9-f2e22b5e67a5","year":2020},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.531854Z"},"links":{"cited_paper":"/paper/2012.11929","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a37c850d7cc235c29f35f31ed9a2d45491eb7c1f13c5220a9a66da1cb86c7222","observation_id":"a85770cb-cfa8-45ba-9f37-9064db54ea4b","resolution":{"observed_at":"2026-08-07T05:20:56.659146Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T05:20:56.536930Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.536930Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a7e0077bcada0a14e33b30d98b280878243f380b4fee9aaef3ef4db0fc3c1b58","observation_id":"b1404a95-a522-4169-adbf-291624ac1cc5","resolution":{"observed_at":"2026-08-07T05:20:56.536930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10132","last_updated":"2021-06-18T13:50:38Z","snapshot_observed_at":"2026-07-06T11:20:43.002537Z","submitted_at":"2021-06-18T13:50:38Z","title":"VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10132","snapshot_observed_at":"2026-08-07T05:20:56.542341Z","title":"Vqmivc: Vector quantization and mutual information-based unsuper- vised speech representation disentanglement for one-shot voice conver- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.542341Z"},"links":{"cited_paper":"/paper/2106.10132","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:b1f32ff686b54945c84320e9caa214daef7874f9eeacae5149ee854091165343","observation_id":"8ad16dc9-375f-4d02-b738-9802b2727d04","resolution":{"observed_at":"2026-08-07T05:20:56.542341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:20:56.547171Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.547171Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:124b2d7da5c1943c6a2e7032197d15362dbf03610383d0c2701ac7eb8212d3e8","observation_id":"134021ad-73cd-4059-9552-ca3d68a60a33","resolution":{"observed_at":"2026-08-07T05:20:56.547171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T05:20:56.553076Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.553076Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:5bf02212529fb4c1f741f1adc1878f387bd645d9532c164df578d42681a33c62","observation_id":"5701ea33-46d4-41af-8625-d3a9f0423779","resolution":{"observed_at":"2026-08-07T05:20:56.553076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.08348."}