{"as_of":"2026-08-13T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ac4e4439092a629cad76bf2fba8002c14e651dd8e422e229b5b0925298de93f","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:41:51.092586Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T15:11:53.320505Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:37:35.394266Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2508.04996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04996","snapshot_observed_at":"2026-07-03T03:37:35.394266Z","title":"Ref-vc: Robust, expressive and fast zero-shot voice con- version with diffusion transformers,","venue":null,"work_id":"34ec4ef1-76ef-4d6c-ad3c-25ff11ff3c54","year":2025},"citing_paper":{"arxiv_id":"2606.09050","last_updated":"2026-06-08T05:39:23Z","snapshot_observed_at":"2026-08-01T21:36:59.520330Z","submitted_at":"2026-06-08T05:39:23Z","title":"MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T15:11:53.320505Z"},"links":{"cited_paper":"/paper/2508.04996","citing_paper":"/paper/2606.09050"},"observation_digest":"sha256:dcd0c9c4d9c10806385128217668037ab96e3a772fb1e2be55fcc71a32a3802e","observation_id":"3a188814-2153-48c8-8567-0a8be66cdcae","resolution":{"observed_at":"2026-07-03T03:37:35.396279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04996/citation-record","integrity":"/paper/2508.04996/integrity","json":"/paper/2508.04996/citation-record.json","paper":"/paper/2508.04996"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.351795Z","title":null,"venue":null,"work_id":"dfe702ba-4a8a-45e5-b097-1101ee967c17","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.018109Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:893487a5f768e9fd7c5e05d8c2da9d3736798b6475fcc996b824d18c5fefe7a7","observation_id":"5f865cc5-d0ca-4be1-aa7d-4a14e91b1026","resolution":{"observed_at":"2026-08-05T23:41:51.354212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.344902Z","title":null,"venue":null,"work_id":"005ab6b0-a96c-42a0-86ce-564f485795ba","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.021002Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:b67517f21091347dc3e4f8c40fed165734ca754fad891bf4cba80e594c8988fe","observation_id":"b2f8d76c-6499-4369-8165-cccfce51b079","resolution":{"observed_at":"2026-08-05T23:41:51.347210Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19770","last_updated":"2025-08-28T13:12:13Z","snapshot_observed_at":"2026-08-12T05:47:34.983835Z","submitted_at":"2024-11-29T15:18:01Z","title":"Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning","version":2},"cited_work":{"arxiv_id":"2411.19770","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19770","snapshot_observed_at":"2026-08-05T23:41:51.188070Z","title":"Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning","venue":"cs.SD","work_id":"cb937cc3-f957-416c-b507-d5cdfe756914","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.023535Z"},"links":{"cited_paper":"/paper/2411.19770","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:5b8595c04c40e7137e6126aacf98c9e63419a4f6b912caf8c231e7306357fb9c","observation_id":"8e24bd62-9aaa-4419-9f49-b82315374a49","resolution":{"observed_at":"2026-08-05T23:41:51.191181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.337885Z","title":"Huang, K","venue":null,"work_id":"b30d06a1-c3d5-4b06-9690-82684610ed05","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.026520Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:6857e160c79e32da8c3c4bcf9b4830e0e89ac916b438b9fc165f107636d9e2e7","observation_id":"54737e80-1c1c-42f1-9868-df0105f7c859","resolution":{"observed_at":"2026-08-05T23:41:51.340340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.330723Z","title":null,"venue":null,"work_id":"31cb83cf-4e9d-4ca6-acea-4c46b91792e5","year":2014},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.028995Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:d2f2646f6f51e6233c171e87dcfef51a18fffc51a7a4b4e1ac64ca6b4ff21e19","observation_id":"c3274d14-aacf-4843-9a2f-d64c443a20fc","resolution":{"observed_at":"2026-08-05T23:41:51.332988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.323412Z","title":"Ahlawat, N","venue":null,"work_id":"93994fb9-eabb-4ae7-b915-085dc18662b9","year":2025},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.031508Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:79a892a5a9ec929cfba64aa28f45fe0ebecf7933a4b5cd2d75ab8f1091a015d5","observation_id":"189ec78c-3f1c-43f1-ba67-dff24b124a2c","resolution":{"observed_at":"2026-08-05T23:41:51.325995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.316365Z","title":null,"venue":null,"work_id":"7f40800c-5ad5-447b-9b09-c210271a284e","year":2016},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.034152Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:aacccac26bb3222aab3c21fa78f7b491395c601a1000783c056779add7bfb4bf","observation_id":"5f56ffcf-8c8f-4c68-b586-1672afe97ab4","resolution":{"observed_at":"2026-08-05T23:41:51.318696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.308846Z","title":null,"venue":null,"work_id":"4702e060-eb0a-41fd-842b-11c599303de8","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.036561Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:cc22f0d1a8dcc7903a4bd567e1e1e4438371505a39c11c02973527eb4234d854","observation_id":"fe8b10cc-f3fb-43c8-b590-2f6fcd0bc41e","resolution":{"observed_at":"2026-08-05T23:41:51.311459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.301477Z","title":null,"venue":null,"work_id":"63439ce3-6c14-4b57-a1d3-144e6c3c749a","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.038848Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:c62ef0ec192e3c1e81beba23aceb25fba62fdc391ca213df726b56bec409e3c3","observation_id":"c6dd4f9e-7302-4197-b081-1563cafa4b02","resolution":{"observed_at":"2026-08-05T23:41:51.303924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.293798Z","title":null,"venue":null,"work_id":"032d70ab-4764-40c2-a4b3-4a3b66e80888","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.041073Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:ace765e84266a3911088aa30b88cc791362d5a6134ba4c1efa6d3cddddbf549e","observation_id":"2ede95de-7c3c-404b-b1d3-34966b782cf1","resolution":{"observed_at":"2026-08-05T23:41:51.296529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.286830Z","title":"Baevski, Y","venue":null,"work_id":"d4bdd23b-622e-4e9f-a426-7c6b9c85b512","year":2020},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.043439Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:964b5031195246c6dacf3f2621aca34213da04c2467484571cc5db1fca18cd52","observation_id":"6fe42ee7-42ed-44f5-a4fb-2abeca115d87","resolution":{"observed_at":"2026-08-05T23:41:51.289123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.279818Z","title":null,"venue":null,"work_id":"3b9363ae-d482-416c-b810-45fc386b342f","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.045760Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:b0f441f7ac5ecb88069004a64ee123f097adaf447818c0f1b5bd2fc165f6fbe1","observation_id":"58b1b59f-a6e3-4bd0-8175-590efc7552a3","resolution":{"observed_at":"2026-08-05T23:41:51.282305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.272576Z","title":null,"venue":null,"work_id":"424b8576-5308-4318-9cd3-6d5eb3a31166","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.048117Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:b19dd79b3df43f60c1ea387f777b63da3de8ed54195986f70f1e01fd8ad298b2","observation_id":"cfa380e1-aa18-4156-9bc1-ff3102f9232b","resolution":{"observed_at":"2026-08-05T23:41:51.274992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.265276Z","title":"Neekhara, S","venue":null,"work_id":"24120344-f09c-495f-bb45-5942deaf2fb4","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.050305Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:da0dbca9c993dc5fed81ac985394b13e4459a20141c35322a54e93f18fa79302","observation_id":"57a14e60-4fbe-49f9-b3d9-4134317b4e06","resolution":{"observed_at":"2026-08-05T23:41:51.267767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.258073Z","title":null,"venue":null,"work_id":"3f46de84-aefb-49a4-8681-307dcbc2848f","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.052572Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:9d0cb14a27f76f8bdca30363387a195d1a7c1b0dd72c2681139f67e5927f9e25","observation_id":"ba2686fd-7807-4d61-b3fa-af9762bd8b16","resolution":{"observed_at":"2026-08-05T23:41:51.260291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09844","last_updated":"2024-06-14T08:51:31Z","snapshot_observed_at":"2026-08-12T23:42:53.233083Z","submitted_at":"2024-06-14T08:51:31Z","title":"Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy","version":1},"cited_work":{"arxiv_id":"2406.09844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09844","snapshot_observed_at":"2026-08-05T23:41:51.177054Z","title":"Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy","venue":"cs.SD","work_id":"f105d276-b374-4362-a670-864a4254557f","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.054837Z"},"links":{"cited_paper":"/paper/2406.09844","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:224b496185edd44af4efe63b20dcf3b1f14b544121b8d106030061bf576591b8","observation_id":"f8592b0d-751d-401a-9be7-643a10ec333c","resolution":{"observed_at":"2026-08-05T23:41:51.180342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16147","last_updated":"2025-09-10T13:42:20Z","snapshot_observed_at":"2026-08-13T11:27:01.317968Z","submitted_at":"2024-11-25T07:14:26Z","title":"QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion","version":2},"cited_work":{"arxiv_id":"2411.16147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16147","snapshot_observed_at":"2026-08-05T23:41:51.165667Z","title":"QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion","venue":"cs.SD","work_id":"f671f763-fb5b-452b-8468-4c5715f02aeb","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.057371Z"},"links":{"cited_paper":"/paper/2411.16147","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:e40f077fd525e44cc68f391b9ff8bbc4e74109abb8745e532a5518a1069c21aa","observation_id":"66587279-1146-452e-8ebd-f987afef12f7","resolution":{"observed_at":"2026-08-05T23:41:51.168878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01350","last_updated":"2025-01-10T05:35:32Z","snapshot_observed_at":"2026-08-12T22:32:46.932318Z","submitted_at":"2024-10-02T09:07:33Z","title":"Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling","version":2},"cited_work":{"arxiv_id":"2410.01350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01350","snapshot_observed_at":"2026-08-05T23:41:51.151962Z","title":"Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling","venue":"cs.SD","work_id":"6d754432-7820-42a5-882f-17e69699940a","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.059823Z"},"links":{"cited_paper":"/paper/2410.01350","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:e40a15857f67aacaa68cbd8e327629da81c2948f6c3c4952ce2a90c4b2df49af","observation_id":"c2fda04f-302d-4776-940c-016614f39ffd","resolution":{"observed_at":"2026-08-05T23:41:51.156909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.250441Z","title":"Peebles and S","venue":null,"work_id":"f6d9e4f5-d6a8-41b1-a96d-dbc96941adf9","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.062258Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:60898d5a02cece2d68599c710d08b902893dc039753b3f56e6df4b066556b48a","observation_id":"74304bea-a1a5-48d6-9a33-ce73d973b29f","resolution":{"observed_at":"2026-08-05T23:41:51.252761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.242735Z","title":null,"venue":null,"work_id":"5f64f160-4107-4c60-b145-ac8d8b0c3bc8","year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.065138Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:b6c1eb5c16558542fe89e179e240d969b9d304c3af98bf2c400fa6078ee54135","observation_id":"52833e86-8688-4ccc-99db-7caf7db748aa","resolution":{"observed_at":"2026-08-05T23:41:51.245248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.235298Z","title":"Lipman, R","venue":null,"work_id":"79652eef-f22c-4927-ae0c-52046522a71b","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.067347Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:3a842680bf6287eee066c51f9c04c0c30481c6035c37e8a859e8bf2677b4c33f","observation_id":"42505878-1417-4968-95b5-912fe957e151","resolution":{"observed_at":"2026-08-05T23:41:51.237959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-08-12T23:38:31.789036Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-08-05T23:41:51.069496Z","title":"Frans, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.069496Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:1ddf762f26899c6b06e16269a3e11bd1ca2e446ac3b0696e8c2235e72dcdc264","observation_id":"c70d84c3-9f5a-4025-b514-2decc5cc80b4","resolution":{"observed_at":"2026-08-05T23:41:51.069496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-13T06:34:37.505459Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-05T23:41:51.071923Z","title":"Liu, ``Zero-shot voice conversion with diffusion transformers,'' CoRR, vol","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.071923Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:f0242253e955a1ee52c00e524a2cd91036d8968ba40292fd5a024c65a3b5df93","observation_id":"b728c6e2-5022-4993-a1fa-bde3f00b2e67","resolution":{"observed_at":"2026-08-05T23:41:51.071923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.227679Z","title":"Zhang, D","venue":null,"work_id":"53d3d03d-623c-42f3-b846-3148148a7ef6","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.074375Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:864bff7b882ed52574f6065fa7f8fc02bce63a5a4e751c996f891219f40856cd","observation_id":"8cbf8caf-4132-4b36-9c3a-842a81a0f745","resolution":{"observed_at":"2026-08-05T23:41:51.230247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.220302Z","title":"Jayashankar, J","venue":null,"work_id":"a8e06508-b77c-48d2-b190-054623f568e0","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.076682Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:4a2fba5838b5dfec7b4680dc9a48e516ccecdd0208da6ca84bd073b1f49825ac","observation_id":"ed4054a2-1290-4704-b946-0b37a39af6ca","resolution":{"observed_at":"2026-08-05T23:41:51.222839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.212905Z","title":null,"venue":null,"work_id":"7229dd70-7957-4b63-a8fa-8540c3ade71d","year":2023},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.078846Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:4d830eeb8a09fe66ffe32f4101a3f430d7dcfebd80a862558ab0ec6b7e52bd9f","observation_id":"4f11c4cf-f5d9-4d90-aaac-f710c39d1507","resolution":{"observed_at":"2026-08-05T23:41:51.215301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-12T23:27:21.977197Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-05T23:41:51.083471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.083471Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:248570096b376a07cd583fb8da4bc27d3c860c8259b33b0ffae29befdea448e3","observation_id":"2dd37568-2bd1-4ee7-bb30-6599b6d618ad","resolution":{"observed_at":"2026-08-05T23:41:51.083471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.204557Z","title":"Zhang, H","venue":null,"work_id":"8d5e4a8e-32d7-4271-8ea3-2de346969b47","year":2022},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.085845Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:5bd67fc42a33a40910e09622f40f9a31bec1e1f1f9ac8a152498a4a3033dd375","observation_id":"9d386117-4436-49f6-9458-055c5007e1e9","resolution":{"observed_at":"2026-08-05T23:41:51.207456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:41:51.196590Z","title":null,"venue":null,"work_id":"65d64575-b89c-4eeb-b71c-b5dd080a08ae","year":2021},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.088055Z"},"links":{"citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:5a551305bdbd0f06cce8d43a7a95a61b581665e6a62e30bb48e05f3883950f7b","observation_id":"af3198a7-5581-4950-8216-5caadd1fe53a","resolution":{"observed_at":"2026-08-05T23:41:51.199452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-05T23:41:51.090161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.090161Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:97d3d75a16258b9ac030c55dd2bd025d4479a8006241e5238555dcf12480c518","observation_id":"68fb7631-fa48-4740-92ed-bf2752351d82","resolution":{"observed_at":"2026-08-05T23:41:51.090161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-11T21:16:54.403783Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-05T23:41:51.092586Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.092586Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:ab1a36b9dbaefeb7b26945948b91ec2ae59ed61771342af881c54f1a6208c24a","observation_id":"c2682900-ab98-4dc0-b954-d0f4287430d1","resolution":{"observed_at":"2026-08-05T23:41:51.092586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T13:44:35.896964Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":9},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2508.04996."}