{"as_of":"2026-08-15T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ea986a896ff3dafacd1f18cf74cc8b8da05866ce37d9ab7429ba97c58177293","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:21:11.466425Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.08791/citation-record","integrity":"/paper/2501.08791/integrity","json":"/paper/2501.08791/citation-record.json","paper":"/paper/2501.08791"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.971155Z","title":"Wavebender GAN: An Architecture for Phonetically Meaningful Speech Manipulation,","venue":null,"work_id":"94d88346-f2fa-44b5-9eac-5d3434915ecd","year":2022},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.320790Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:84c659c54a7c3388d85628254f30a577ddc50e01c67ed51e4fbeeb01abc6e2c4","observation_id":"a403030d-cf9a-43e4-8e50-6371ec11f365","resolution":{"observed_at":"2026-08-10T20:21:11.975189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.959503Z","title":"Hierarchical Intonation Modelling for Speech Synthesis using Legendre Polynomial Coefficients,","venue":null,"work_id":"f49b3eef-c7cc-4d72-b081-e91fe84606c7","year":2024},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.325576Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:21aa537456b6ff5dacb056323e2c0abfd6a308258eacd0ac1b1744fc29017c92","observation_id":"f45060a3-0a18-43b2-99c7-7d3ce487c989","resolution":{"observed_at":"2026-08-10T20:21:11.963507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.947305Z","title":"Prosody-Controllable Spontaneous TTS with Neural HMMs,","venue":null,"work_id":"20301470-71fe-4d70-89a4-cc493f0e47f7","year":2023},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.329764Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:33ddf36d154bdcfb8babff49565cd48ccd58398b7be6ef044f67e0137466f239","observation_id":"598f31eb-ddfb-4199-a2d6-451c3317cdbf","resolution":{"observed_at":"2026-08-10T20:21:11.952017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.933661Z","title":"Towards End-to-End Prosody Transfer for Expressive Speech Synthesis with Tacotron,","venue":null,"work_id":"c0f5db7a-0993-4317-ad0d-49170bca9295","year":2018},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.334148Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:30d4bdf4ab6dd6f974216989d608ac4ec6627d55b734255110c4669938338338","observation_id":"972306d0-0ab6-435b-8a0e-f5fc80b82bb4","resolution":{"observed_at":"2026-08-10T20:21:11.938960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.921324Z","title":"An Overview of Affective Speech Synthesis and Conversion in the Deep Learning Era,","venue":null,"work_id":"a377f2ba-0530-491b-976a-2f063c1cf422","year":2023},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.339565Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:46acd218b97bebe1b2cff5a719ad32422b3b1f492423090c97466df0819d24c3","observation_id":"9c07f95b-4d24-4d16-aa0d-cebcd51d3ccb","resolution":{"observed_at":"2026-08-10T20:21:11.925605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14523","last_updated":"2024-06-27T15:14:58Z","snapshot_observed_at":"2026-08-14T07:09:46.430544Z","submitted_at":"2024-02-22T13:15:49Z","title":"Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition","version":2},"cited_work":{"arxiv_id":"2402.14523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14523","snapshot_observed_at":"2026-08-10T20:21:11.536096Z","title":"Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition","venue":"cs.CL","work_id":"bbe21d49-0e6f-463e-b283-0af9016d760f","year":2024},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.344244Z"},"links":{"cited_paper":"/paper/2402.14523","citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:35c38f96da0f5c69e8bb5793c4a1c7dcc2db02103634c5aaff560be68841866c","observation_id":"a54a0c56-453f-4127-92fc-062fbddda77f","resolution":{"observed_at":"2026-08-10T20:21:11.540844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.908930Z","title":"Singh, Profiling Humans from their Voice , vol","venue":null,"work_id":"f54729a9-fe87-4495-bdc0-dfd0cb9cabf9","year":2019},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.349795Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:97f47fae40c61c4369c9c8d361e18ad13ad92edbf970a8670d2458d07d57ceb7","observation_id":"a9a96a70-0b27-4f0c-9092-6ab48b9adae9","resolution":{"observed_at":"2026-08-10T20:21:11.913156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.889567Z","title":"The Analysis of V oice Quality in Speech Processing,","venue":null,"work_id":"8ce717a6-28ca-40b4-b082-22fc00f46e60","year":2004},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.355139Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:53440400aa988149ce939f4da5823fe6cb776bde82032a0c34e05001b5786e52","observation_id":"02fceaf0-e9e4-4131-92d5-f64dfe95f9f7","resolution":{"observed_at":"2026-08-10T20:21:11.899351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.874039Z","title":"GTR- V oice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis,","venue":null,"work_id":"55f1f62c-993b-4500-97b3-144e2bf3eb79","year":2024},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.360871Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:8e5cc433c4f7d35cd3d630622682826969864123c1068acd293fdbcce2438ad1","observation_id":"7207f9ca-88dd-4d53-b9fc-202a7072f9df","resolution":{"observed_at":"2026-08-10T20:21:11.878879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.861545Z","title":"PerMod: Perceptually Grounded V oice Modification with Latent Diffusion Mod- els,","venue":null,"work_id":"c9964d6e-42a5-4281-a626-12f8f47152e5","year":2023},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.365099Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:b02bed9fa19dea49409114a9a3f8c30b41d1c460360211ad90e17fef45e4a14c","observation_id":"7d90085d-67b9-45b4-abf8-5fc79b433950","resolution":{"observed_at":"2026-08-10T20:21:11.866102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.846351Z","title":"Consensus Auditory-Perceptual Evaluation of V oice: Development of a Standardized Clinical Protocol,","venue":null,"work_id":"cf3806a1-4a99-490c-89a5-437b40822d4c","year":2009},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.369956Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:52b6f4138456b7a6d101bc5072a29cdba459641fed98c9b9291eb6515c3cf91e","observation_id":"d67d9528-8755-41d5-94d3-f0feb3b37e92","resolution":{"observed_at":"2026-08-10T20:21:11.851058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.11241","last_updated":"2020-08-25T19:06:03Z","snapshot_observed_at":"2026-07-06T09:50:06.310950Z","submitted_at":"2020-08-25T19:06:03Z","title":"ANGUS: Real-time manipulation of vocal roughness for emotional speech transformations","version":1},"cited_work":{"arxiv_id":"2008.11241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.11241","snapshot_observed_at":"2026-08-10T20:21:11.515917Z","title":"ANGUS: Real-time manipulation of vocal roughness for emotional speech transformations","venue":"cs.SD","work_id":"b473cabd-8231-492c-b3b8-edd091af586a","year":2020},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.374792Z"},"links":{"cited_paper":"/paper/2008.11241","citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:199ecad366901c22bd717e9e8b5f7f10bfd5ed8668c55f64224576cd0d392068","observation_id":"824d44cc-c21d-4c5f-8072-acffaca61c15","resolution":{"observed_at":"2026-08-10T20:21:11.522552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.832140Z","title":"Stochastic Models of Pitch Jitter and Amplitude Shimmer for V oice Modification,","venue":null,"work_id":"ee250c9d-c7ff-41cc-af15-679510fddfb4","year":2008},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.380396Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:fe04bada0ad466ef9c00eb02ef56ca4c46d817b6f073b3daefd234ea92a30793","observation_id":"eb128758-5cdb-4878-93ee-78464f31be05","resolution":{"observed_at":"2026-08-10T20:21:11.837166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.814909Z","title":"Introducing Roughness in Individuality Transformation through Jitter Modeling and Modification,","venue":null,"work_id":"12caf668-783a-4132-8a78-7710d8a48619","year":2005},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.385547Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:d3a902dbc107ee2c3e0b9632b4713885df401ba44b6938b295a5ec3272addacb","observation_id":"188aadc1-77c6-45c6-9964-88590baf2405","resolution":{"observed_at":"2026-08-10T20:21:11.821260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.797090Z","title":"Towards an Interpretable Representation of Speaker Identity via Perceptual V oice Qualities,","venue":null,"work_id":"ac0d9c2d-23ef-47ea-a18a-0e8c228149f4","year":2024},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.389339Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:148f37e673256b14e6e9bc82eee05b8bdd2e67bbdce1f4bc66d68f982351589a","observation_id":"881ebd74-1819-478b-9c9d-680b4e190d55","resolution":{"observed_at":"2026-08-10T20:21:11.804844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.781457Z","title":"Variational Inference with Normalizing Flows,","venue":null,"work_id":"bcb807a6-e21f-476a-aea0-b4762f23688e","year":2015},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.392881Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:e02a3e31f8de49c82648679a3df456ae0d22a388ac75f49fedbb8a0713b896d6","observation_id":"c2412392-f19c-4683-8185-19178bd437b2","resolution":{"observed_at":"2026-08-10T20:21:11.787011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.766641Z","title":"Normalizing Flows: An Introduction and Review of Current Methods,","venue":null,"work_id":"c7677d25-0c51-4d36-b165-3b73256bb4c8","year":2020},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.396694Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:3b6313ad51db92398185e00c60d01ad9aef41a7133affe7cd4e9eab5e162cec8","observation_id":"ab597d77-d8fe-4537-8ec3-4838117a218f","resolution":{"observed_at":"2026-08-10T20:21:11.771634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06674","last_updated":"2024-04-11T17:52:15Z","snapshot_observed_at":"2026-08-14T07:09:25.913530Z","submitted_at":"2024-04-10T01:33:08Z","title":"VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06674","snapshot_observed_at":"2026-08-10T20:21:11.400979Z","title":"V oiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot V oice Editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.400979Z"},"links":{"cited_paper":"/paper/2404.06674","citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:b7e8117f7a71df8d8a9db464fc23ea9494031d08593861e5f1b80a25654c5c59","observation_id":"9c8eedd9-40fb-4811-ba1b-7f829a4d7745","resolution":{"observed_at":"2026-08-10T20:21:11.400979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.749434Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero- Shot V oice Conversion for Everyone,","venue":null,"work_id":"e95459d3-d0a6-47f9-b137-c0a320ca493e","year":2022},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.405213Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:d371ec980d832d07b3885b469805cef37e9b31222323c6428734c824e947efd6","observation_id":"926c83a4-0423-4814-9df9-c4ef2f13873b","resolution":{"observed_at":"2026-08-10T20:21:11.757824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.735735Z","title":"StyleFlow: Attribute- conditioned Exploration of StyleGAN-Generated Images using Condi- tional Continuous Normalizing Flows,","venue":null,"work_id":"a7804cc4-a675-49b3-bcf9-f39266b2ecb8","year":2021},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.409233Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:a6b76763fc010d1e56feb701940ab0bb08edd5e3d47921f2015456c54d022a07","observation_id":"7a089b10-cea0-4009-83d3-0dd1b1adb3c0","resolution":{"observed_at":"2026-08-10T20:21:11.740274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.722990Z","title":"Neural Ordinary Differential Equations,","venue":null,"work_id":"2091875e-e1a8-4618-9abd-361acd6dbe58","year":2018},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.413209Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:3ba9eadb56774f23f45dde67518be1803e0f84ef96b134244d42cb174409fac2","observation_id":"8b7d786e-0741-4926-b820-f85c03327205","resolution":{"observed_at":"2026-08-10T20:21:11.727347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.708741Z","title":"FFJORD: Free-Form Continuous Dynamics for Scalable Reversible Generative Models,","venue":null,"work_id":"c9a02793-8ef8-4a11-8872-431d5beeddea","year":2019},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.417190Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:12e2b2ecd90f7f7a600a304c99664704e72608465b460c701c6c98dfe7f4a318","observation_id":"a67fd7b2-3f93-4c7b-a056-99737a977fb4","resolution":{"observed_at":"2026-08-10T20:21:11.713801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.695515Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech,","venue":null,"work_id":"ebf6859a-d171-4f87-b940-36c1a5ea2c55","year":2021},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.421287Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:cc140cf3a6956b9975f9aa126d8c3a36b403b9254aa4c50f41af32c568b4753c","observation_id":"65c1dc8b-eb4a-4748-be24-1da9f39b8c53","resolution":{"observed_at":"2026-08-10T20:21:11.700038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.679787Z","title":"Frame-Wise and Overlap-Robust Speaker Embeddings for Meeting Diarization,","venue":null,"work_id":"9f6ea50a-b259-4323-a2e4-94ac0a3d0a61","year":2023},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.425454Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:3bae59bedb74a25733c23b4ea62679906285bdbc266d377cd385c01b09754196","observation_id":"3af26ae8-ea09-4d52-9746-701677091c84","resolution":{"observed_at":"2026-08-10T20:21:11.684900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.666680Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus,","venue":null,"work_id":"fd1cb07a-70ee-4648-a07d-a7510d973689","year":2023},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.429326Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:ba0b65bf1f3a0f63e224942b89435953425a1e8c2db89512624fcb4e72341c17","observation_id":"1a8f6f0e-567b-4d7b-b06d-ce2b63410149","resolution":{"observed_at":"2026-08-10T20:21:11.671084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.653149Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to- Speech,","venue":null,"work_id":"75778c84-09fc-4ec3-b8e2-534b17bb8138","year":2019},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.433394Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:8223cb21cf4a1b3131594fd2068d6798c5d2ecd7cc2d6aa3bcc45e03bfe589c2","observation_id":"e63652f6-0fc4-4646-9a1c-635ae1550d96","resolution":{"observed_at":"2026-08-10T20:21:11.657571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.640149Z","title":"Perceptual V oice Qualities Database (PVQD): Database Characteristics,","venue":null,"work_id":"f870adc5-a4be-4588-855d-8ab24995482a","year":2022},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.437969Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:7c0bf0e5b82ac36b3532d723edf60e7177dbf41027748fe330b3ceacaf1c30cb","observation_id":"ded872f9-a7fa-45db-9e87-18e404515a24","resolution":{"observed_at":"2026-08-10T20:21:11.645003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.627629Z","title":"HuBERT: Self-Supervised Speech Represen- tation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"2afadf89-3124-4604-8c98-8ae170d82cdf","year":2021},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.442264Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:00d0b8ca620e1929be4ddaa70e3ff366bc6e684f17d80cec53529949982c4a0c","observation_id":"fe2ecf40-1383-4363-99da-bf0bd200adb7","resolution":{"observed_at":"2026-08-10T20:21:11.631818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.615412Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":"c353a2e8-a18e-4f80-abab-94263ab30f05","year":2021},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.446558Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:6b2947fbaa22330aca5956fe971b86deee5b8633dca0df9ca8695b5adf6cad86","observation_id":"f7f39146-9a07-4624-b7dc-d9154da440b9","resolution":{"observed_at":"2026-08-10T20:21:11.619731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.601754Z","title":"Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi,","venue":null,"work_id":"ce941c32-7ea8-4fa9-b179-cd4289b43eb5","year":2017},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.450692Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:290abda7381e3c7a0031c97e7af2156b5d646e592de65b72ed49ff4b536ea509","observation_id":"2f31ecb7-1d41-4141-a25f-45f5fe59a478","resolution":{"observed_at":"2026-08-10T20:21:11.606334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.588691Z","title":"ITU-T Rec. P.808, Subjective evaluation of speech quality with a crowdsourcing approach,","venue":null,"work_id":"c59be311-4443-4b35-84e2-4ab99a60ef36","year":2018},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.454518Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:bf58aac68e6dfad49a1f9268c2ae8c2738176f9e6062fa9fbf1939c7245640db","observation_id":"14bd73a8-eb6c-4fa8-9a6a-cb12dda5fe0a","resolution":{"observed_at":"2026-08-10T20:21:11.593260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.575690Z","title":"V oice Conversion Challenge 2020 — Intra- lingual semi-parallel and cross-lingual voice conversion —,","venue":null,"work_id":"43931b31-405e-4bfb-98fe-0ec02f663b9e","year":2020},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.458478Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:f4264c9aeb1f87b9180a9e06e67268c1415d92615fdaa7ea436b5a4876a7dba4","observation_id":"b338ce23-14a1-4924-8fe1-4473e241b6bf","resolution":{"observed_at":"2026-08-10T20:21:11.579986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.562611Z","title":"Constructing Confidence Sets Using Rank Statistics,","venue":null,"work_id":"3f0ef697-5e3a-47c0-b274-b3253dd0c6ed","year":1972},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.462466Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:a447b0fa60f68164b231a6d9de878b1a9b26428cd965aa6c0ab012b9ac782e52","observation_id":"db01be4b-7f44-4c9d-ba6c-ede997f2313d","resolution":{"observed_at":"2026-08-10T20:21:11.566799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:21:11.549716Z","title":"Interactions Between Breathy and Rough V oice Qualities and Their Contributions to Overall Dysphonia Severity,","venue":null,"work_id":"30553941-5b41-4d04-b6bf-c383525e18ea","year":2022},"citing_paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:21:11.466425Z"},"links":{"citing_paper":"/paper/2501.08791"},"observation_digest":"sha256:2c9e62c4069c5880f993127f08a47b0b1daefc4ca6b6adb5b5880cda3ccc4597","observation_id":"72d33cff-3d46-483a-94cf-36656545f8b1","resolution":{"observed_at":"2026-08-10T20:21:11.554235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.08791","last_updated":"2025-01-15T13:33:40Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T20:15:15.852159Z","submitted_at":"2025-01-15T13:33:40Z","title":"Speech Synthesis along Perceptual Voice Quality Dimensions"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":2,"verified_fuzzy":31},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2501.08791."}