{"as_of":"2026-08-10T07:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d78b59e60e6573f9ccc4fc91d84e0571e8711b96d172a99dc2596742d42e48fa","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:57.704298Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:54.607029Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:12:58.752132Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"cited_work":{"arxiv_id":"2506.00350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00350","snapshot_observed_at":"2026-08-07T12:12:58.752132Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","venue":"cs.SD","work_id":"870c6da6-869e-44be-af53-e91a50a15ca2","year":2025},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.607029Z"},"links":{"cited_paper":"/paper/2506.00350","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:448c29314cbc1dfbf0a0440bed940436873b05eebf70d316f0cb09279bf0b39a","observation_id":"c33947e5-950d-47ac-8725-d5349767934e","resolution":{"observed_at":"2026-08-07T12:12:58.874171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00350/citation-record","integrity":"/paper/2506.00350/integrity","json":"/paper/2506.00350/citation-record.json","paper":"/paper/2506.00350"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"cited_work":{"arxiv_id":"2506.00350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00350","snapshot_observed_at":"2026-08-07T12:12:58.752132Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","venue":"cs.SD","work_id":"870c6da6-869e-44be-af53-e91a50a15ca2","year":2025},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.607029Z"},"links":{"cited_paper":"/paper/2506.00350","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:448c29314cbc1dfbf0a0440bed940436873b05eebf70d316f0cb09279bf0b39a","observation_id":"c33947e5-950d-47ac-8725-d5349767934e","resolution":{"observed_at":"2026-08-07T12:12:58.874171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.512095Z","title":"It comprises a speech content encoder, a speaker identity encoder and a latent diffusion-based speech generator","venue":null,"work_id":"82855fcc-9878-4b3a-910c-1e126f80e361","year":null},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.660498Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:be02e22d4888fa51b9903c61ddab1c2bc3b7e8651457dc0cddb6b8026fef4711","observation_id":"13a870bb-e8b2-4b20-a3bf-fd6edaf99cea","resolution":{"observed_at":"2026-08-07T12:13:03.587354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.343291Z","title":"Datasets and Training Details Experiments are conducted on the UASpeech [33], LibriSpeech [34], VCTK [35] and LibriTTS [36] datasets","venue":null,"work_id":"9be47dc7-b04f-4411-8b4c-73bb187031db","year":null},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.738183Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:64ad664ef6b2730a9e039f8eea61a170b026303d2b053ce1ff2a2ed191ae456e","observation_id":"370e4d6f-e54b-4dae-83e2-662ee45ff085","resolution":{"observed_at":"2026-08-07T12:13:03.419620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.943044Z","title":"We explore and compare three widely used SSL speech foundation mod- els for content restoration","venue":null,"work_id":"cb721568-94f2-462a-853e-00f4bad6a2db","year":null},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.890870Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:45d16f6b2dfa80ed6085d77fd4f94ad5dd7cf9a5563cdc39cce2f6b6bdfc6999","observation_id":"5c3545ac-00a9-48c3-af3a-6c7eb3a3bfc9","resolution":{"observed_at":"2026-08-07T12:13:03.001868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.012506Z","title":"Hilvoice: Human-in-the-loop style selection for elder-facing speech synthe- sis,","venue":null,"work_id":"566c1d20-7579-43ea-b8dc-0f7ba9e6f317","year":2022},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.300793Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:4849496fafef7a8cc4bd9ba465e3b957841fb1c84d5dce6fed3ab15f4caedd71","observation_id":"59e88356-18bd-45e5-bbe9-299a3a69f712","resolution":{"observed_at":"2026-08-07T12:13:02.052738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.707278Z","title":"Speech motor control is task-specific: Evidence from dysarthria and apraxia of speech,","venue":null,"work_id":"a9c593b4-29c7-4d90-b6c9-ebf9f4992c5b","year":2003},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.958946Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:f5adaf33c6484bf1788c83fbc8712661dd893e3dcd9fcc6cb54dd52fa4549a0d","observation_id":"f948787d-d7cc-4c26-b758-7d2dd9721342","resolution":{"observed_at":"2026-08-07T12:13:02.804814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.410064Z","title":"Multiple factors are involved in the dysarthria asso- ciated with parkinson’s disease: a review with implications for clinical practice and research,","venue":null,"work_id":"db6f3fe9-b4c5-4c3d-8832-6b78f624a432","year":2014},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.059702Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:1f1384138e98dedff38d2a76db1a200bb4ccdb8839495f48dae2e57ce50b2665","observation_id":"3a64aeb6-267d-4f2d-8f39-4bd43bf1d881","resolution":{"observed_at":"2026-08-07T12:13:02.488416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.255907Z","title":null,"venue":null,"work_id":"868220a4-ef91-4643-b6fc-56a416cd105a","year":2023},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.152387Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:b0ff6180b0fb743db56255f9e6438250976efe587eb381830b477348ca8f1615","observation_id":"828bb94d-605f-43e7-8087-513780464749","resolution":{"observed_at":"2026-08-07T12:13:02.290556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:02.109599Z","title":"Speech synthesis technologies for individuals with vocal disabilities: V oice banking and reconstruction,","venue":null,"work_id":"0a00756a-9920-4255-8d49-525cee492760","year":2012},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.218636Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:c0ae3988ca1a39d1066cbd52c4221368b5b0eedabfcbfe087989416939c595bd","observation_id":"fcf87f01-addf-49cf-a15b-7972c42ff295","resolution":{"observed_at":"2026-08-07T12:13:02.159765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.074442Z","title":"Un- supervised multi-scale expressive speaking style modeling with hierarchical context information for audiobook speech synthesis,","venue":null,"work_id":"f89c37a4-6880-44cc-a52a-25b93fdb4839","year":2022},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.658371Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:c80e0d5002a0b83bb72c742819e9d62886e6d7ea221d1968e0aa78adea8224a8","observation_id":"bbed0885-8437-46ff-907f-5374510868a0","resolution":{"observed_at":"2026-08-07T12:13:01.208835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.829757Z","title":"Improving the intelligibility of dysarthric speech towards enhancing the effectiveness of speech therapy,","venue":null,"work_id":"14fa711e-bec8-4725-921d-b62b8ffcfdc7","year":2016},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.407316Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:fca82f9091cb7860ca8de06a87569213e0b54d91534812b60ad6ad9a915cebc7","observation_id":"40c7bd31-2c04-4a07-ab4c-e0dc1037ab5a","resolution":{"observed_at":"2026-08-07T12:13:01.928516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.551805Z","title":"Phoneme-discriminative features for dysarthric speech conversion","venue":null,"work_id":"1232f6da-a1ac-40aa-86f9-667435baea5f","year":2017},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.452702Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:9acd9cb1811da6defcfe9e269d64412bee066cb17c21f4ac59badfd5e611a01c","observation_id":"445c4f73-44cb-418d-bd71-9380f2d26a76","resolution":{"observed_at":"2026-08-07T12:13:01.672900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:01.304576Z","title":"End-to-end voice conversion via cross-modal knowledge dis- tillation for dysarthric speech reconstruction,","venue":null,"work_id":"fb8403f6-d151-4693-ad4f-a844296cbdc2","year":2020},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.563500Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:3e3255b7f3b6209c0ee88481431daee39d1e34ff2a80d108830ab7bd7d17af7f","observation_id":"ff8fe4d3-5eab-4b9e-a915-29fd3565de0e","resolution":{"observed_at":"2026-08-07T12:13:01.392950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01678","last_updated":"2021-06-17T12:50:49Z","snapshot_observed_at":"2026-08-03T12:31:04.097299Z","submitted_at":"2020-11-03T13:08:53Z","title":"Learning Explicit Prosody Models and Deep Speaker Embeddings for Atypical Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01678","snapshot_observed_at":"2026-08-07T12:12:55.623245Z","title":"Learning explicit prosody models and deep speaker embeddings for atypical voice conversion,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.623245Z"},"links":{"cited_paper":"/paper/2011.01678","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:8d2c4e70130c1e52090d3bca2d9458e1a8aaa44db50824a0bbad06eb8ac24687","observation_id":"3c0c861b-d61b-48d0-bcd6-847d98c48012","resolution":{"observed_at":"2026-08-07T12:12:55.623245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16078","last_updated":"2024-03-24T09:42:05Z","snapshot_observed_at":"2026-07-06T17:49:40.841846Z","submitted_at":"2024-03-24T09:42:05Z","title":"Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy","version":1},"cited_work":{"arxiv_id":"2403.16078","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16078","snapshot_observed_at":"2026-08-07T12:12:58.153497Z","title":"Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy","venue":"cs.SD","work_id":"b03c72b7-9fe1-4ee5-85a2-a0f5be9a85f9","year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.103217Z"},"links":{"cited_paper":"/paper/2403.16078","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:0416213fe2af978856c854ee1002172fabc8c013618528a47f8890054c4dbff8","observation_id":"f92b8cc3-804e-40a3-8380-88f511d8dbc0","resolution":{"observed_at":"2026-08-07T12:12:58.218475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:00.796454Z","title":"Stylespeech: Self-supervised style enhancing with vq- vae-based pre-training for expressive audiobook speech synthe- sis,","venue":null,"work_id":"21855035-3c46-4869-8336-afeb7ae9b015","year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.750273Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:6bf266fc8495878bffdfbaccbea05e75d4ff539e423d2dd7cece17bd6a9ce286","observation_id":"77f03264-2eee-4f3c-9b1f-03bf8b413a98","resolution":{"observed_at":"2026-08-07T12:13:00.885586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14664","last_updated":"2024-01-26T06:08:47Z","snapshot_observed_at":"2026-07-06T17:20:45.227692Z","submitted_at":"2024-01-26T06:08:47Z","title":"UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization","version":1},"cited_work":{"arxiv_id":"2401.14664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.14664","snapshot_observed_at":"2026-08-07T12:12:58.499426Z","title":"UNIT-DSR: Dysarthric Speech Reconstruction System Using Speech Unit Normalization","venue":"cs.SD","work_id":"f5b96ab2-08eb-4c54-8f23-03dd3c22405a","year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.845257Z"},"links":{"cited_paper":"/paper/2401.14664","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:77743d3e15663096c1f12ce65ada668203c9c90cd1092920f9b9ee0c6a4babee","observation_id":"62205423-eab1-44c0-8393-2d64f89a05e4","resolution":{"observed_at":"2026-08-07T12:12:58.567959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:55.912711Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:55.912711Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:44d78c7e8edea3fd7e091c3965696227bf8865bf0d3a7a3b7feb71ee90ae136d","observation_id":"5b67f647-abd1-4423-82e8-477fbd5bed02","resolution":{"observed_at":"2026-08-07T12:12:55.912711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17796","last_updated":"2024-01-31T12:45:43Z","snapshot_observed_at":"2026-08-03T15:47:57.291398Z","submitted_at":"2024-01-31T12:45:43Z","title":"Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction","version":1},"cited_work":{"arxiv_id":"2401.17796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.17796","snapshot_observed_at":"2026-08-07T12:12:58.305672Z","title":"Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction","venue":"cs.SD","work_id":"910adea0-2d7e-4ade-9559-5ae5098e3a87","year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.017033Z"},"links":{"cited_paper":"/paper/2401.17796","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:0317ecbd2b121cd113e9bbb1c159ad4595ed36d2652872d5aa8915193dffb173","observation_id":"867ef544-8127-46fa-96e3-8194d6586b82","resolution":{"observed_at":"2026-08-07T12:12:58.355641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-07T12:12:56.521378Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.521378Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:c80b74ba8604ec99777aa4eb78d64b766ee555d6a81afdf310f7871a9db6a3eb","observation_id":"c81be0c0-cace-4669-9c66-de1481f693ff","resolution":{"observed_at":"2026-08-07T12:12:56.521378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08336","last_updated":"2024-06-24T06:09:42Z","snapshot_observed_at":"2026-07-06T18:29:44.841845Z","submitted_at":"2024-06-12T15:42:21Z","title":"CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction","version":2},"cited_work":{"arxiv_id":"2406.08336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08336","snapshot_observed_at":"2026-08-07T12:12:58.023792Z","title":"CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction","venue":"cs.SD","work_id":"e226b5dd-d343-4882-a0cb-fefd796dc8eb","year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.176399Z"},"links":{"cited_paper":"/paper/2406.08336","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:f3d20d2a0669f071f04cb46d7cffdb3c9127f70eec46c892049b98b47466c439","observation_id":"f588ee1c-9101-4f6d-b3d2-59b3481db563","resolution":{"observed_at":"2026-08-07T12:12:58.086706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:12:56.274668Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.274668Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:009f16bf4630157b0608fef53b09310d790bec861e9a26cc8ea7653dc339c8d4","observation_id":"5eedcd3b-a9f5-4164-b969-e7bb4aaf7623","resolution":{"observed_at":"2026-08-07T12:12:56.274668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T12:12:56.370877Z","title":"Vall-e 2: Neural codec language models are hu- man parity zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.370877Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:f109a4783c9b909967ba0a8a13ebcc00c20be9e16ff007994f1b37c44f44f299","observation_id":"170af19d-7e84-4a5d-bd61-fb515caa88a5","resolution":{"observed_at":"2026-08-07T12:12:56.370877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-07T12:12:56.445581Z","title":"Naturalspeech 2: Latent diffusion models are natu- ral and zero-shot speech and singing synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.445581Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:5d4030ea8853eeabe086b3fd5f9d47dd05c765acdc2154406340487ab9a6e468","observation_id":"74c40840-3b67-4339-a24d-74fc4cd50c58","resolution":{"observed_at":"2026-08-07T12:12:56.445581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:56.940520Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.940520Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:11a65ed433ae23a2716be1745a8894f5b42968c6658465b7833bf67ee4b32f48","observation_id":"f7c1add0-ceac-4dea-b729-6ebe22c7d392","resolution":{"observed_at":"2026-08-07T12:12:56.940520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-07-06T18:25:09.965258Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-07T12:12:56.625844Z","title":"Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.625844Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:2a99bbc66020113432f5351f6fd8ba5005ad2e99f5bf4e510baf8fc513d1688b","observation_id":"cb511548-a040-4418-975d-3dd8512cc73a","resolution":{"observed_at":"2026-08-07T12:12:56.625844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:00.486274Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":"3d54b982-c189-4c79-92c9-5cf849a9cee0","year":2023},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.709933Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:e06dd51181814f19ec6923961155ba29efeb78d7fed4718c874346ae97870f64","observation_id":"96fc2471-b4a3-49e3-8736-409a498ad618","resolution":{"observed_at":"2026-08-07T12:13:00.674488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:03.152383Z","title":"The L1 distances between the dysarthric speeches and corre- sponding reconstructed speeches are calculated and results are shown in Table 4","venue":null,"work_id":"fcccc300-57de-4f84-8fb1-25429aeea2fe","year":null},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.834160Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:dec2c91df37177af4d7ee822b42fce770f7b762156e6cd9d4342d8b5527d77f2","observation_id":"d074973b-59c3-46a0-8485-159141633250","resolution":{"observed_at":"2026-08-07T12:13:03.270700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:13:00.218976Z","title":"Video gen- eration models as world simulators,","venue":null,"work_id":"ad958707-7602-4666-9943-b55de3cebf9b","year":2024},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.784838Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:299c595d105bb51a4d348bd93d0ce4e83f0055a00ac2d692dee859637fc38266","observation_id":"0a471d6e-8923-4031-8d61-4555efb72dc4","resolution":{"observed_at":"2026-08-07T12:13:00.333343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:56.861619Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:56.861619Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:a4938c294ab35579b6a3c77b3fa710c5d0259acda797a135cd1f40b0b7db739c","observation_id":"94fe480d-d8f5-47e7-ab70-7b6a6a1e43ce","resolution":{"observed_at":"2026-08-07T12:12:56.861619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.008659Z","title":"Improving automatic speech recogni- tion performance for low-resource languages with self-supervised models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.008659Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:a682fc29c5d1e913e72d807bb9e8add73caa123af89017a98ba5cacaa8e9f043","observation_id":"1cfc7dc7-4854-4408-8620-3b5dd41d49df","resolution":{"observed_at":"2026-08-07T12:12:57.008659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:12:57.079433Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.079433Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:e2b5d9f84e1ba4a9de88f54b35190307a101602417c1c92328d2149f80e6549d","observation_id":"4e84a817-b3e0-4c4d-b306-64fb7277ed19","resolution":{"observed_at":"2026-08-07T12:12:57.079433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:59.915815Z","title":"Generalized end- to-end loss for speaker verification,","venue":null,"work_id":"67fc87e8-841f-49d3-93ef-bc7a169c4c65","year":2018},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.149324Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:11e345ab52295c7274d60f1906ddf1858b401c83806577112132126e56ef9237","observation_id":"60653cd5-6ed5-4a93-ba22-7a3774496805","resolution":{"observed_at":"2026-08-07T12:13:00.009221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04416","last_updated":"2025-01-08T11:04:30Z","snapshot_observed_at":"2026-08-08T23:40:27.195926Z","submitted_at":"2025-01-08T11:04:30Z","title":"ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04416","snapshot_observed_at":"2026-08-07T12:12:57.241564Z","title":"Zsvc: Zero-shot style voice conversion with disentangled la- tent diffusion models and adversarial training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.241564Z"},"links":{"cited_paper":"/paper/2501.04416","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:1ec84deb33dc3ff971776ba9128d679085eb0beb41467867f9e311cd3c78bc08","observation_id":"76b09370-129b-436f-93aa-eec1a6c3e74e","resolution":{"observed_at":"2026-08-07T12:12:57.241564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T12:12:57.332166Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.332166Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:1b5fead4ff557b561c5b669e474317ae697c32126a5a5bf81534f166d5ce99ee","observation_id":"8e54977a-623a-4e17-8a4a-7fe3fa1eb790","resolution":{"observed_at":"2026-08-07T12:12:57.332166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T12:12:57.357887Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.357887Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:05b7e1b58caba68eebcda340f4b8d02dd572d6546a964d762f915059a4a268a0","observation_id":"28c6cab5-1945-48c2-9fc3-f4162815c91f","resolution":{"observed_at":"2026-08-07T12:12:57.357887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.449233Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.449233Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:82d95eafe92ff034f7eb0f85dc8c16bc36e3e4e754cbaba041233dddb909d571","observation_id":"53a5863b-4af8-468e-b855-1bcf35558fe2","resolution":{"observed_at":"2026-08-07T12:12:57.449233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:59.543891Z","title":"Dysarthric speech database for universal access research,","venue":null,"work_id":"bf6c15fe-03b1-4446-8d61-4271818f6e0d","year":2008},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.504511Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:a220cb7009aa7e0f04864652afaaefc5202eb25cbaaaad48dc978f7b579656dd","observation_id":"c73d1472-f4f8-40ae-9333-49fb3cd68a86","resolution":{"observed_at":"2026-08-07T12:12:59.704461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:57.553902Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.553902Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:122738b167a36961d3632fe0397b586fddb56a461df6a6797914b8fc8e5d744f","observation_id":"2f21b7f1-fa9c-4056-84ab-0890d7c1546b","resolution":{"observed_at":"2026-08-07T12:12:57.553902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:59.205047Z","title":"Superseded-cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"9c8d502d-e1a8-4ed0-bc93-3d730ae60388","year":2016},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.628295Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:bba5cc496c5d1132d3f63cb9931dcf2b4cb91029089369cb21590df9e0a2a6ed","observation_id":"00f1fd80-2bc9-47a4-b031-6a5278359672","resolution":{"observed_at":"2026-08-07T12:12:59.340937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:58.989400Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"8dcf22f9-c9f6-4f1c-8bb2-395845d381b6","year":2019},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.704298Z"},"links":{"citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:eae88bbf613af39b088f6c2e7154a4cba57f0aaf9a4df3fac9785de5faceeb82","observation_id":"1fea7679-3aac-41b4-b0a0-40b73d4beb33","resolution":{"observed_at":"2026-08-07T12:12:59.090189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":5,"verified_fuzzy":19},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.00350."}