{"as_of":"2026-08-10T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9d734cf83adea1c430768eadd4b6936eff1b61fa7911a8a3d7795ece20e0a2d","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:15:52.190529Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:58.610208Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:00:08.120813Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05471","snapshot_observed_at":"2026-08-07T14:58:58.610208Z","title":"Preprint, arXiv:2502.05471","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.610208Z"},"links":{"cited_paper":"/paper/2502.05471","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:8b00a00e157e73e93092133c54b4ca5d61478654ab6862a0b5f0cbb908cabf3b","observation_id":"74f6896e-0381-4b69-8a07-941b1548c3bc","resolution":{"observed_at":"2026-08-07T14:58:58.610208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05471","snapshot_observed_at":"2026-08-07T11:57:58.568919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.568919Z"},"links":{"cited_paper":"/paper/2502.05471","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:37139d8c423cc69ec91c6fd17265c498a72352edc416d951c70b182e6eb91169","observation_id":"69fa6331-1fd0-4995-8696-417777240f33","resolution":{"observed_at":"2026-08-07T11:57:58.568919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"cited_work":{"arxiv_id":"2502.05471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05471","snapshot_observed_at":"2026-08-06T21:00:08.120813Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","venue":"cs.SD","work_id":"2b173808-57f0-4636-9f03-a7c04c4a996d","year":2025},"citing_paper":{"arxiv_id":"2507.01348","last_updated":"2025-07-08T09:21:24Z","snapshot_observed_at":"2026-08-08T00:30:57.740737Z","submitted_at":"2025-07-02T04:30:23Z","title":"SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:00:08.017244Z"},"links":{"cited_paper":"/paper/2502.05471","citing_paper":"/paper/2507.01348"},"observation_digest":"sha256:7ab40406d2b0dc171cd43339a24e7b35150c134c4718e4bea7c5657b151ba679","observation_id":"8432b24e-8c02-4f75-883e-c008952b50d2","resolution":{"observed_at":"2026-08-06T21:00:08.183010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05471/citation-record","integrity":"/paper/2502.05471/integrity","json":"/paper/2502.05471/citation-record.json","paper":"/paper/2502.05471"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.882871Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss,","venue":null,"work_id":"e9fc9048-18b9-4a8e-b7bc-bbda6fe822fd","year":2019},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.034234Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:21fa5b1cbd2b5e43cb37709a98a707e60f687f6f87042db668e9d6b5f0c61e2c","observation_id":"5d84f3fd-9b4c-4204-b572-9064d89a5838","resolution":{"observed_at":"2026-08-08T19:15:52.887514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.869887Z","title":"V oicemixer: Adver- sarial voice style mixup,","venue":null,"work_id":"8904e535-991a-4678-9e24-acecde31a6d8","year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.039255Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:dc6f156757a74293e91d334cfbe914a17571daabdd64a35f2263d9e4306b5ab8","observation_id":"93a89f50-f21d-4408-b5ae-cf42c10a674c","resolution":{"observed_at":"2026-08-08T19:15:52.873972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05742","last_updated":"2019-08-22T17:18:16Z","snapshot_observed_at":"2026-07-06T07:45:28.742612Z","submitted_at":"2019-04-10T16:22:18Z","title":"One-shot Voice Conversion by Separating Speaker and Content Representations with Instance Normalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05742","snapshot_observed_at":"2026-08-08T19:15:52.044146Z","title":"One-shot voice conversion by sep- arating speaker and content representations with instance normalization,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.044146Z"},"links":{"cited_paper":"/paper/1904.05742","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:1f49265ccca4dc42d5102bc544ca759c5904980c279c67b70d54aa117bcb1cfc","observation_id":"d8af58c6-fcea-4d97-8b41-58ab72fbedfd","resolution":{"observed_at":"2026-08-08T19:15:52.044146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.048846Z","title":"Again-vc: A one- shot voice conversion using activation guidance and adaptive instance normalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.048846Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:c91cd802943732fc33773cff86d8963dbf7e48ca898a9f09c8aa617e34344058","observation_id":"43547107-ed32-4a3a-b534-064397af18dc","resolution":{"observed_at":"2026-08-08T19:15:52.048846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.848296Z","title":"Unsupervised speech decomposition via triple information bottleneck,","venue":null,"work_id":"7db06f82-72cd-49ac-bd2e-65c35314c984","year":2020},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.053187Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:27c7483ae94db21dd65b3a4d81f81ce76a137cc1c52c6ce73df4a2e75aa25186","observation_id":"4cb787d0-464c-4fcd-8407-52687a4eabd1","resolution":{"observed_at":"2026-08-08T19:15:52.852583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.835019Z","title":"Neural analysis and synthesis: Reconstructing speech from self-supervised representa- tions,","venue":null,"work_id":"8228e077-b327-47b9-b682-4a58dd43adc0","year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.057935Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:f11ba681b8e99574084d9a703685c8fd1ad8a3bd52a53c77ec27c2746268d9ac","observation_id":"b245516c-ce93-4249-bb02-3e955d060569","resolution":{"observed_at":"2026-08-08T19:15:52.839279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.062671Z","title":"Expressive-vc: Highly expressive voice conversion with attention fusion of bottleneck and perturbation features,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.062671Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:7bef424568557d04213d4d58b2979a65b2b0c3245713c78f3429470090145977","observation_id":"a2649297-bf2f-4482-9e64-dad6d626e485","resolution":{"observed_at":"2026-08-08T19:15:52.062671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.813689Z","title":"Contentvec: An improved self-supervised speech representation by disentangling speakers,","venue":null,"work_id":"cdc34af4-26e4-4c16-9f20-eaf698bdb885","year":2022},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.066933Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:4afcc0fa4b39acc27443758c6ebc6b62469cac5d8a2a5fd2a9c2cbf847b032ab","observation_id":"6441b8f8-fa2c-4e16-b2ed-17aafe308749","resolution":{"observed_at":"2026-08-08T19:15:52.817906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16083","last_updated":"2023-06-28T10:30:39Z","snapshot_observed_at":"2026-07-06T15:47:42.066252Z","submitted_at":"2023-06-28T10:30:39Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16083","snapshot_observed_at":"2026-08-08T19:15:52.070918Z","title":"Unitspeech: Speaker- adaptive speech synthesis with untranscribed data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.070918Z"},"links":{"cited_paper":"/paper/2306.16083","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:e8c2e03f159fedd8c6762ff150d023eda07fc06314c03baafb626dff37ad6d88","observation_id":"3a85f7a5-9e41-456a-ba72-9a176f078019","resolution":{"observed_at":"2026-08-08T19:15:52.070918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.800349Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"d883edc4-5bb7-455f-a9f1-b8e7cbf0c5dc","year":2022},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.075200Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:93fe0436ce64cb50d7aeec19b7d7474b9182cc57b2769f412b773ff19a16473d","observation_id":"38b95a36-cb90-4933-9d2a-9d3ab2c38828","resolution":{"observed_at":"2026-08-08T19:15:52.804918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06410","last_updated":"2023-06-10T11:04:10Z","snapshot_observed_at":"2026-07-06T15:41:05.902201Z","submitted_at":"2023-06-10T11:04:10Z","title":"OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment","version":1},"cited_work":{"arxiv_id":"2306.06410","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.06410","snapshot_observed_at":"2026-08-08T19:15:52.593288Z","title":"OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment","venue":"cs.CL","work_id":"9cb51eb1-ef70-4b11-80b9-445c12e0feb4","year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.079358Z"},"links":{"cited_paper":"/paper/2306.06410","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:995ca9d20d54224cbb028026a922635949ee275c9634562292f2908403873443","observation_id":"1523f89e-a3ba-433c-910f-ad5e671b769b","resolution":{"observed_at":"2026-08-08T19:15:52.599589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.786498Z","title":"Diff-hiervc: Diffusion-based hier- archical voice conversion with robust pitch generation and masked prior for zero-shot speaker adaptation,","venue":null,"work_id":"e33cbc38-e05a-4a7e-be4a-8efddf8c91f2","year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.083533Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:db6abf2963ec9e4fe48cbb86866f9bde7e84217c148c18e1a5b6ec423d8fb80f","observation_id":"87f5e7dc-3889-406c-a99a-02e538b44f82","resolution":{"observed_at":"2026-08-08T19:15:52.790811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15197","last_updated":"2023-12-23T08:45:57Z","snapshot_observed_at":"2026-08-02T21:07:22.279100Z","submitted_at":"2023-12-23T08:45:57Z","title":"TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15197","snapshot_observed_at":"2026-08-08T19:15:52.087678Z","title":"Transface: Unit-based audio-visual speech synthesizer for talking head translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.087678Z"},"links":{"cited_paper":"/paper/2312.15197","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:8e1b26b85024e136a6b2cc9913ce5fafd4c7b9f0d9d191c930dec7f9d684b7a8","observation_id":"82359265-8bcb-441c-92b6-2f423f7bf549","resolution":{"observed_at":"2026-08-08T19:15:52.087678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.091850Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.091850Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:caf52d15c6d55e0e1b232a70b6ef26894a15fda19cdcb7839ed91c6d04743644","observation_id":"6aa15f87-6d3e-42c3-835e-378f81d778c7","resolution":{"observed_at":"2026-08-08T19:15:52.091850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-08T19:15:52.095800Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.095800Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:fe9e26088b61e9df82d29ffada4ca766f8ba68feae9050f81094f91fc7e97a0c","observation_id":"7aaf16de-cdf7-47dd-9d8b-0e43c321bd87","resolution":{"observed_at":"2026-08-08T19:15:52.095800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.764686Z","title":"Dgc-vector: A new speaker embedding for zero-shot voice conversion,","venue":null,"work_id":"4cb31231-164d-4da7-b4ab-e5bf72203e75","year":2022},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.100086Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:0792edad5ed66c83e969b205015fb71594c933ca4f4d7e40b3a7fbde6847607c","observation_id":"ad0c4ef2-79d1-43d7-8272-972afc4e003f","resolution":{"observed_at":"2026-08-08T19:15:52.769014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.751707Z","title":"Zero-shot multi-speaker text-to-speech with state-of-the- art neural speaker embeddings,","venue":null,"work_id":"fad4ef5b-5a9d-4d3a-93a8-b2c10b262852","year":2020},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.104052Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:1390076cd8f8266b15f1f8133bc097bc336d4161058995712efbac1e1b89e19e","observation_id":"d57c9866-9809-4f2d-9c37-af4da096c778","resolution":{"observed_at":"2026-08-08T19:15:52.756026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.107919Z","title":"Sef-vc: Speaker embedding free zero-shot voice conversion with cross attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.107919Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:82b0261069c8a4962f22faf5507e8885ce781958db5edb39c353fbb8a15d43e3","observation_id":"9f88f6c7-6892-4eeb-8dbd-d307c5e12eac","resolution":{"observed_at":"2026-08-08T19:15:52.107919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.729463Z","title":"Refxvc: Cross-lingual voice conversion with enhanced reference leveraging,","venue":null,"work_id":"9637b087-1689-4ce0-86d7-e677be68cf87","year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.111782Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:aa79c4c80a201d99d981fc659a8c5dc7cdfe0a3db06eec7699bdb0bd5e5da421","observation_id":"2fda4c95-d68c-4d21-82d7-5bafa7c93a60","resolution":{"observed_at":"2026-08-08T19:15:52.733770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.716284Z","title":"Zero-shot voice conversion via self-supervised prosody representation learning,","venue":null,"work_id":"7f51a7bd-d046-40b7-a9e3-d62d40885674","year":2022},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.116371Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:144317746f57ac88269bb151ec4e992c1fdf5d08b8ed4a7177c9bcdb607eb1ea","observation_id":"d393707e-dfb3-4b75-a6b8-12d9dc40ff9a","resolution":{"observed_at":"2026-08-08T19:15:52.720572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.702579Z","title":"Promptvc: Flexible stylistic voice conversion in latent space driven by natural language prompts,","venue":null,"work_id":"3aefd6a3-6124-40e2-a913-f464a981b7c7","year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.120562Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:62503c49e25518640455910501ab237e63ffc48978c9563dfa0d50c38724a597","observation_id":"e4cb2835-65ba-4e4a-839b-281ff92ae0f6","resolution":{"observed_at":"2026-08-08T19:15:52.707301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13612","last_updated":"2023-05-23T02:20:47Z","snapshot_observed_at":"2026-08-09T23:19:26.013206Z","submitted_at":"2023-05-23T02:20:47Z","title":"FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13612","snapshot_observed_at":"2026-08-08T19:15:52.124370Z","title":"Fluentspeech: Stutter-oriented automatic speech editing with context- aware diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.124370Z"},"links":{"cited_paper":"/paper/2305.13612","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:d2cf0f382b7620d8b08f559b2ce3890d6c2967903b2cfe77e1e4d0ffbe5c71af","observation_id":"e194f579-f819-468f-bf1b-ed4792528fbc","resolution":{"observed_at":"2026-08-08T19:15:52.124370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.128771Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.128771Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:8805991db136b86a69bdefe51af5094134a6a451d75db0f8ccbe5fa3d4b94c61","observation_id":"93fd6717-fcae-4e11-8b67-9220276b82f5","resolution":{"observed_at":"2026-08-08T19:15:52.128771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-09T13:24:51.366298Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-08T19:15:52.133057Z","title":"Speech resynthesis from discrete disentangled self-supervised representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.133057Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:8fa96b1ace8a92916b1434973c1d6b8c4516e8f7c89c4ca958f8d95f1aca44f6","observation_id":"6340e8b2-c522-4926-9e68-620a185f2abc","resolution":{"observed_at":"2026-08-08T19:15:52.133057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-08T19:15:52.137166Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.137166Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:1ad4507486f55713a0e0970ee0ab703c814601ac350e2d94336de996e6749fbf","observation_id":"38995372-dcbe-4898-9df2-0961d064be26","resolution":{"observed_at":"2026-08-08T19:15:52.137166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.141263Z","title":"Ace: A generative cross-modal re- trieval framework with coarse-to-fine semantic modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.141263Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:75695cb76faae550f31e7e9e41f15a12db4a0f84ef9350e2bfbad0118871b326","observation_id":"bc9bc02f-b76f-46c1-8358-ec84892ab68e","resolution":{"observed_at":"2026-08-08T19:15:52.141263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-08T19:15:52.145073Z","title":"Mega-tts: Zero-shot text-to-speech at scale with intrinsic inductive bias,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.145073Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:8146131a7c90180fcce546b727ed9e5a53f548e26fa220b30301f7e8c9247ad1","observation_id":"eaa02832-2131-4664-832e-6c0440586611","resolution":{"observed_at":"2026-08-08T19:15:52.145073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-08T19:15:52.149153Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.149153Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:b93ab1a22e8a63b32460bcc6956cc501c4519305c10306aac7d06cfc1a6d9edb","observation_id":"287fa4db-112d-461a-bf0b-212ed2e208de","resolution":{"observed_at":"2026-08-08T19:15:52.149153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.680181Z","title":"Neural ordinary differential equations,","venue":null,"work_id":"e2d34a4c-0fdd-4ad8-a0d4-5e8e6650e4d2","year":2018},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.153410Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:6f41eef87d9d79abb7ec08d34d73b5030623cd857734e21d3d1162ff2f1282c4","observation_id":"75f19251-7957-4dfc-8a97-d9e9c0bf4ed3","resolution":{"observed_at":"2026-08-08T19:15:52.685090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-08T19:15:52.157201Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.157201Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:79d9cdda9cd2e894dbeb4d000ea247c19f4fc12325addcbb6382235b4f6f1e1e","observation_id":"3d6a598e-5eb3-4808-a4fa-9a2d80d7b681","resolution":{"observed_at":"2026-08-08T19:15:52.157201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-08T19:15:52.161357Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.161357Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:1cfd105197086e7316992f837b06f8ea1f4cd2a3a0fee52388b6242589e765a8","observation_id":"39624ee8-c5e4-474c-bd57-5436f2d96644","resolution":{"observed_at":"2026-08-08T19:15:52.161357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-08T19:15:52.165447Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.165447Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:962ec20f2ed9672d5b09bfb41d69312d92da96364f718ce14c0a85d462ec0d6d","observation_id":"5a9459da-28bb-4a7e-9ac9-3aa110f5e83f","resolution":{"observed_at":"2026-08-08T19:15:52.165447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.169472Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.169472Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:f380cf5380dea917553b0606d32bc59f7fffdddb38b0c873ca37f5028560e170","observation_id":"d0efcc18-4f6e-4ecb-ae43-e1f71c48e62b","resolution":{"observed_at":"2026-08-08T19:15:52.169472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.174166Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.174166Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:8288dc53b7d5c91ca5457862aeee1d06a02211dbd2740a47ce5a976bfad59f93","observation_id":"ce3c3db8-3abc-4b9d-b97d-7b59327a41d8","resolution":{"observed_at":"2026-08-08T19:15:52.174166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.649996Z","title":"Matcha-tts: A fast tts architecture with conditional flow matching,","venue":null,"work_id":"073ebfb1-3aec-4f72-bd2e-ccf8770a9b75","year":2024},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.178133Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:60c711dbb10f03fd68e15a39e9f88329bc993daf7086d933dc77ba111d2c6217","observation_id":"7a5f6dbd-87cb-464d-b939-b4990f0428ed","resolution":{"observed_at":"2026-08-08T19:15:52.654476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-08T19:15:52.182473Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.182473Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:f3f9159e60318de7d6ee4b25c480b87e7e82822a7b4ed3927c13732ebcc80133","observation_id":"143e4c8e-f340-4307-b93c-822ef83fa9be","resolution":{"observed_at":"2026-08-08T19:15:52.182473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:15:52.636531Z","title":"F0- consistent many-to-many non-parallel voice conversion via conditional autoencoder,","venue":null,"work_id":"06ec8443-fd30-457c-85e2-1aa234721e32","year":2020},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.186723Z"},"links":{"citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:e48185a140188849dbbb6ebf234c8b9d46086770e3df73c353bd8eca7062b7a6","observation_id":"7c2ebe9d-6be7-41f6-a18d-7d3b966b2fb1","resolution":{"observed_at":"2026-08-08T19:15:52.640937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03264","last_updated":"2022-05-10T16:41:20Z","snapshot_observed_at":"2026-08-09T18:33:35.704437Z","submitted_at":"2021-09-07T18:03:21Z","title":"Text-Free Prosody-Aware Generative Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03264","snapshot_observed_at":"2026-08-08T19:15:52.190529Z","title":"Text-free prosody-aware generative spoken language modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.190529Z"},"links":{"cited_paper":"/paper/2109.03264","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:0e69e89410b2d2da5af02869d6ea4a936da1e4d0972e1ff8678024a9721862c2","observation_id":"e7e8479f-ed8a-4ef3-ab44-15efc7b8ad70","resolution":{"observed_at":"2026-08-08T19:15:52.190529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 3 inbound Pith citation observations for arXiv:2502.05471."}