{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ed64a72a9847b8c61ccaf27a20830839d367b422c21a8418646a2c087c29a2c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:56:27.098917Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:56:24.413325Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:56:27.602379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"cited_work":{"arxiv_id":"2506.01032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01032","snapshot_observed_at":"2026-08-07T11:56:27.602379Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","venue":"cs.SD","work_id":"0378734f-d0e5-4aca-acea-0284b1e6b425","year":2025},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.413325Z"},"links":{"cited_paper":"/paper/2506.01032","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:91bf603cb37bceaa7c26722a9b8dd36dfb0b5168a8a6ff20d54e44d7c5fa46d1","observation_id":"69be4a59-e668-404b-a959-0208d6ea4ba8","resolution":{"observed_at":"2026-08-07T11:56:27.654727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01032/citation-record","integrity":"/paper/2506.01032/integrity","json":"/paper/2506.01032/citation-record.json","paper":"/paper/2506.01032"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.570582Z","title":"VC achieves this by decom- posing the source speech into different components, including the speaker’s timbre, linguistic content, and speaking style","venue":null,"work_id":"de70dc83-f976-49e5-a3be-01c397b0f3b5","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.323895Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:b67d90a434d7c75e738b0ae360eacf752cac4517f224dfb026b2be6a41cc0236","observation_id":"158cdc83-d220-4cb2-ab56-b8a8d5c7bfab","resolution":{"observed_at":"2026-08-07T11:56:30.692554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"cited_work":{"arxiv_id":"2506.01032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01032","snapshot_observed_at":"2026-08-07T11:56:27.602379Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","venue":"cs.SD","work_id":"0378734f-d0e5-4aca-acea-0284b1e6b425","year":2025},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.413325Z"},"links":{"cited_paper":"/paper/2506.01032","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:91bf603cb37bceaa7c26722a9b8dd36dfb0b5168a8a6ff20d54e44d7c5fa46d1","observation_id":"69be4a59-e668-404b-a959-0208d6ea4ba8","resolution":{"observed_at":"2026-08-07T11:56:27.654727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.414094Z","title":"Encoder The encoder consists of an average voice encoder, Hubert-Soft [16], a speaker encoder, VQ-V AE, and a feature fusion mod- ule","venue":null,"work_id":"e5750802-9e74-4a7b-bb20-93a6ae558700","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.521096Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:a692b3512e5c97be12f6e8289575e0e84dbb39b07adbc6b10d02f21ea816a65b","observation_id":"8763bd55-c397-4e4a-bcbb-0062d7ec033f","resolution":{"observed_at":"2026-08-07T11:56:30.467818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.218649Z","title":"Experimental Setup 4.1.1","venue":null,"work_id":"c9a5685f-fa5b-4fed-9a32-580edb1ec63d","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.629403Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:a15b088d370259bc114b8ceb63d025e4ee08aff832992efc3e1040573f9e161c","observation_id":"b7e91cae-e49c-44a7-ae4c-271eb0f272ee","resolution":{"observed_at":"2026-08-07T11:56:30.324358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.900928Z","title":"ReFlow-VC can use the RK45 ODE solver for sampling, generating speech samples with optimal audio quality","venue":null,"work_id":"c5493e0e-80f5-4bb0-a97b-5f14a0ceb60d","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.842396Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:ab3c2077a859cf3bffc00e5e6ef04d66b3cb6f58f283309a68cc0a03e3178f93","observation_id":"214678d2-8aab-467c-bd48-621e47d7748f","resolution":{"observed_at":"2026-08-07T11:56:29.973300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.737453Z","title":null,"venue":null,"work_id":"768fe550-d0b9-4dab-92ec-44998b03127a","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.913275Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:8d5f4f3133773098be4a7d58e7b10e4e0f1c1806d348cb24b99c45f1554730cd","observation_id":"2c21e631-8391-41b6-87f9-6ff5ca67a700","resolution":{"observed_at":"2026-08-07T11:56:29.818998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.024372Z","title":"Cyclegan-vc: Non-parallel voice conversion using cycle-consistent adversarial networks,","venue":null,"work_id":"a90c7846-337e-496d-b3d5-fa00adcf93a3","year":2018},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.509024Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:fc0b53cb517974af28ffe585a45400614b9b7f9df22c6541acf6f8d79c162841","observation_id":"28da9560-8bcd-4632-8b2f-249b729ee5b5","resolution":{"observed_at":"2026-08-07T11:56:29.091663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.611013Z","title":"Privacy and utility of x-vector based speaker anonymiza- tion,","venue":null,"work_id":"ac5e7d99-52a6-4a8f-9988-1d553ab169a4","year":2022},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.990199Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:2288ad32d89aedd8a15c0ed9072bc95c1f535d7d90f986f3e5c8eb882d86f515","observation_id":"0eb97054-3189-4fd1-9061-82c2693a45dc","resolution":{"observed_at":"2026-08-07T11:56:29.673659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.440193Z","title":"Autovc: Zero-shot voice style transfer with only au- toencoder loss,","venue":null,"work_id":"7509ca68-18c4-40f1-b9ac-25427fb806f2","year":2019},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.063692Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:af14e13844c0d578f383144de2dc86485f275179bda7053e406776646ec730de","observation_id":"df061bb7-9505-4c24-8407-c1c6e5f21e89","resolution":{"observed_at":"2026-08-07T11:56:29.532141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.301039Z","title":"Again-vc: A one-shot voice conversion using activation guidance and adap- tive instance normalization,","venue":null,"work_id":"5081e933-679e-4e7e-8094-1a9f8f2d05a1","year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.156702Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:d09d3a12f7b85641ddfad214dffe50db476127022e63e7c0d25ec1b40bb16505","observation_id":"80818db0-09fb-488f-a04c-02b757355f6f","resolution":{"observed_at":"2026-08-07T11:56:29.365146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.176497Z","title":"Gemo-clap: Gender-attribute-enhanced contrastive language- audio pretraining for accurate speech emotion recognition,","venue":null,"work_id":"9ab9f171-68fc-4b91-a1f3-06a6008c2be1","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.265163Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:1735825d4cd263fec3fcec9db66a9e5c19f5c2bed42f0f192e365bf53f57f069","observation_id":"e1309a94-e214-4b1d-a623-e2da6f4363b6","resolution":{"observed_at":"2026-08-07T11:56:29.214321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.340534Z","title":"Ace- vc: Adaptive and controllable voice conversion using explicitly disentangled self-supervised speech representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.340534Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:4d479a64f0d2e7002b8674a4004ddbbdf53ad7856603c525e4448dbbd51849b0","observation_id":"66734f72-d119-4c2b-beb2-523cbe00f4cf","resolution":{"observed_at":"2026-08-07T11:56:25.340534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10185","last_updated":"2019-07-24T00:37:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-24T00:37:20Z","title":"Non-Parallel Voice Conversion with Cyclic Variational Autoencoder","version":1},"cited_work":{"arxiv_id":"1907.10185","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.10185","snapshot_observed_at":"2026-08-07T11:56:27.474999Z","title":"Non-Parallel Voice Conversion with Cyclic Variational Autoencoder","venue":"eess.AS","work_id":"029cc54c-1cec-4597-a17b-169a47def217","year":2019},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.416182Z"},"links":{"cited_paper":"/paper/1907.10185","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:247be04694583f712c047a33028a2515f919b13577b8ef67d7022b1c9db16d45","observation_id":"701efda3-043e-4175-b5f6-48add114b86f","resolution":{"observed_at":"2026-08-07T11:56:27.522823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.278428Z","title":"Dddm-vc: Decoupled denoising diffusion models with disentangled representation and prior mixup for verified robust voice conversion,","venue":null,"work_id":"a9e370ad-4216-41dd-8a8c-a9d1b934dea1","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.082385Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:58c37d2aae47066ed739a03b4eb222d51cdc0214911a4ad090e62c3199dca39e","observation_id":"40ae660b-ea3c-4806-8810-6cd872c68837","resolution":{"observed_at":"2026-08-07T11:56:28.366411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.900738Z","title":"Generative adver- sarial networks,","venue":null,"work_id":"83d0933b-767b-4e5f-8934-0c3e20c2bb4c","year":2020},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.598126Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:d2e0f3e99f371de5f6641852b9296b77fe7cc5fe85e2b4534530d0ab181875e4","observation_id":"bb5b6982-d170-4ed8-a8ab-544c7620bf09","resolution":{"observed_at":"2026-08-07T11:56:28.951288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.758422Z","title":"Cyclegan- vc2: Improved cyclegan-based non-parallel voice conversion,","venue":null,"work_id":"2c2f79af-b9e9-48e5-8c63-cff486735f18","year":2019},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.685267Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:f1c5fe2e14d8b29a35c1d304d85a08ca97d3c56135505f9e189260883103d794","observation_id":"a96ced03-f733-47c7-a74b-9fee0d0d6d07","resolution":{"observed_at":"2026-08-07T11:56:28.834699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.646818Z","title":"Stargan-vc: Non-parallel many-to-many voice conversion using star genera- tive adversarial networks,","venue":null,"work_id":"fb8829cf-9383-4d5b-a13d-44bcbf88bdac","year":2018},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.776761Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:15ca2b8b53ce731d5a9d3bf712b537bdedd84c5e3698d501d8a6811686bdc4c2","observation_id":"9b49f441-e0fc-47d6-8be7-6755a0ed9354","resolution":{"observed_at":"2026-08-07T11:56:28.693746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.869060Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.869060Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:113d793b84e2ab9f3ec3d99f69373f8244a67ae87fd067392de3c7267df1dfb1","observation_id":"978f9bfe-4495-4704-ab32-ee00eefd0404","resolution":{"observed_at":"2026-08-07T11:56:25.869060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-07T11:56:25.936184Z","title":"Diffusion-based voice conversion with fast maximum likelihood sampling scheme,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.936184Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:e82871c1362095d6f376b558aabdf6a07f872e1b21fe9c9af364c0e402bef913","observation_id":"e638bdbd-8655-4859-a950-a8396c317d62","resolution":{"observed_at":"2026-08-07T11:56:25.936184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.446159Z","title":"Reflow-tts: A rectified flow model for high-fidelity text-to- speech,","venue":null,"work_id":"afb56f5a-0e11-4f17-b265-7138e4b11d51","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.015110Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:d7a3d81a6abcb4758ecf5eb44c10a0de95b9f5554baa75920fc8c95aa15cad0d","observation_id":"ee4c4c4e-bc66-4e03-85c4-c51a34b6626a","resolution":{"observed_at":"2026-08-07T11:56:28.509039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:26.685169Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.685169Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:12194e81f6ab274a1395a43696b5c7cc290174ae9bba76c9c0aafa75832cd3ae","observation_id":"648d8f50-cf54-4332-bcc3-d15ef3efed28","resolution":{"observed_at":"2026-08-07T11:56:26.685169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T11:56:26.164721Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.164721Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:5dfcc8b055465ee158b5704798258e11966878f1d5fa4015d016203b85188715","observation_id":"67d80638-dbdc-4918-9e78-f9346234f4e4","resolution":{"observed_at":"2026-08-07T11:56:26.164721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.103253Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"5a5e3028-d4c4-4f52-af5f-50160d2ab577","year":2022},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.250848Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:f6373a3e99c58b803a7fd0205fa477b64b5a31b04fc24af9934e95e71ab53be7","observation_id":"4cbd47af-8a34-42eb-b285-8f5ca317a065","resolution":{"observed_at":"2026-08-07T11:56:28.188153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-09T13:24:51.366298Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-07T11:56:26.345966Z","title":"Speech resynthesis from dis- crete disentangled self-supervised representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.345966Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:ecd348ea307f218d66acf86e7437958835471283acc48e52e9253e3731994af6","observation_id":"eeebdec5-02a3-4389-bf12-bc264f94427c","resolution":{"observed_at":"2026-08-07T11:56:26.345966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04416","last_updated":"2025-01-08T11:04:30Z","snapshot_observed_at":"2026-08-08T23:40:27.195926Z","submitted_at":"2025-01-08T11:04:30Z","title":"ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04416","snapshot_observed_at":"2026-08-07T11:56:26.433423Z","title":"Zsvc: Zero-shot style voice conversion with disentangled la- tent diffusion models and adversarial training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.433423Z"},"links":{"cited_paper":"/paper/2501.04416","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:bc958ae2e442573e307c865cb2a0cf698b12dcb62ed7b24e01e3635d5cdbcf0f","observation_id":"c3b103a8-05ae-4853-9180-1373feef1466","resolution":{"observed_at":"2026-08-07T11:56:26.433423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02026","last_updated":"2025-08-10T04:48:33Z","snapshot_observed_at":"2026-07-06T19:44:47.582139Z","submitted_at":"2024-11-04T12:23:17Z","title":"Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":"2411.02026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02026","snapshot_observed_at":"2026-08-07T11:56:27.271513Z","title":"Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching","venue":"cs.SD","work_id":"86044218-fbf3-4e65-a13c-a802e481c640","year":2024},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.530413Z"},"links":{"cited_paper":"/paper/2411.02026","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:d955b6e225287235eb273eb1f57ae2877208c6503253b107a900f0f9a233b9ad","observation_id":"d100de23-1730-49a4-be1d-62572a48914d","resolution":{"observed_at":"2026-08-07T11:56:27.320718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.926499Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"7eccc510-9055-48ba-9708-a87a2f372e13","year":2015},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.592381Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:050059817f1a0a2d7e993f9a169bc9263229d9c7e903450d50479da2e35d5dfc","observation_id":"aafa886a-6d5b-453d-a6df-d92b310798d3","resolution":{"observed_at":"2026-08-07T11:56:27.997312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T11:56:26.818986Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.818986Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:4566652293ab99dcf77ab688f7e2830f259560c86db665850848c1e1be314194","observation_id":"725c1408-5ac8-4947-b6b7-9fed0b823b63","resolution":{"observed_at":"2026-08-07T11:56:26.818986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T11:56:26.905749Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.905749Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:1349f8a9a56507d17f6906dfa249bcc84cc1fc05b4dd8ef10a92c4fb1181afab","observation_id":"007dcde5-8537-43e9-adf3-a5132140a35c","resolution":{"observed_at":"2026-08-07T11:56:26.905749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.003061Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:27.003061Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:166945132c75b26e5e80f27a19cefccb8af5562de25e3d2fddd53422bf99f2e7","observation_id":"70ef9325-7ef1-4873-8941-4c56aaa07e6c","resolution":{"observed_at":"2026-08-07T11:56:27.003061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.733300Z","title":"Whis- per: Tracing the spatiotemporal process of information diffusion in real time,","venue":null,"work_id":"eda81d66-02b2-4455-922e-9535b944eb6a","year":2012},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:27.098917Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:93247ba6317a139088ca3b509e4663a3ddce74a52f363d9262703f94b34ca8a9","observation_id":"76c56840-f1ae-4dd0-97f8-ab290b59047d","resolution":{"observed_at":"2026-08-07T11:56:27.801674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:30.054393Z","title":"We used the pre-trained HiFi-GAN [24] as the neural vocoder, which is responsible for converting the mel spectrograms into raw wave- forms","venue":null,"work_id":"4003b977-caa8-45b9-8d5b-5d5038f2c728","year":null},"citing_paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.766859Z"},"links":{"citing_paper":"/paper/2506.01032"},"observation_digest":"sha256:40f796a464c60f9be881d082bedbcebe2a8d3cdda914d325bd7a5c29ec83754a","observation_id":"df16ac5d-54a6-46aa-9e59-cf858949d778","resolution":{"observed_at":"2026-08-07T11:56:30.115942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01032","last_updated":"2025-06-01T14:21:07Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T01:45:34.667300Z","submitted_at":"2025-06-01T14:21:07Z","title":"ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":3,"verified_fuzzy":18},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2506.01032."}