{"as_of":"2026-08-16T09:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d260b09e9135996a79508d9678062f793da842770e6b8a292df7dc689e3bb96","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:16:12.952995Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08117/citation-record","integrity":"/paper/2412.08117/integrity","json":"/paper/2412.08117/citation-record.json","paper":"/paper/2412.08117"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:12.887746Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.887746Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:26ecb1ce6b1f372d0587f17600445aac0df1b259adf221c2abf1bd13234eddce","observation_id":"8f711594-054f-4465-b33b-08feedcfa46a","resolution":{"observed_at":"2026-08-11T18:16:12.887746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T18:16:12.891891Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.891891Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:a2925e987ef4994dbab4eed10ef15656308f8e13c927800d9d4ab88fca0d00ab","observation_id":"9b3d9a24-927e-49c2-b31d-8966c22dab90","resolution":{"observed_at":"2026-08-11T18:16:12.891891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:12.894872Z","title":"High-resolution image synthesis with latent diffu- sion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.894872Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:edc27b1d7139c4fa02d087a81fd1c585baa990f50aadd4c296a5ba13cc14b6cb","observation_id":"df2212d3-512f-44a9-b4eb-3266bc94de1c","resolution":{"observed_at":"2026-08-11T18:16:12.894872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T18:16:12.897783Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.897783Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:0c452e134cbd7c8585946709f85461932bd91bedfffc585b6acdcbb649a9fbba","observation_id":"720960e0-eec0-4241-93e2-80741af4382f","resolution":{"observed_at":"2026-08-11T18:16:12.897783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T18:16:12.901379Z","title":"Imagen video: High definition video generation with diffusion models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.901379Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:6c1ebe99c2dcebe373b5190f51da2c1f5c0c9c80cb732febe92ae65a9f8fea25","observation_id":"7793e79e-f2e5-444f-86c5-1434dd298a43","resolution":{"observed_at":"2026-08-11T18:16:12.901379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-14T21:09:20.948173Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-11T18:16:12.905818Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.905818Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:77042df9c914a9d039dc196ce71be5b6261b6840f6ecde9bf665ee5cad2bfa44","observation_id":"5a410033-4c77-4bd8-9410-ed42a2f2ea06","resolution":{"observed_at":"2026-08-11T18:16:12.905818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.096434Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":"972e4dad-8247-4453-8c34-97d1139e51fe","year":2019},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.909401Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:43b68bba6ae7e769194b7794b069eaffafd238ef294f2da934e3d2e6623fc344","observation_id":"6fb9159b-4922-41f7-9d6b-bf0387be0815","resolution":{"observed_at":"2026-08-11T18:16:13.099427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.088116Z","title":"Stylespeech: Parameter-efficient fine tuning for pre-trained controllable text-to- speech,","venue":null,"work_id":"5b55c2ad-6e60-4ff3-bac0-e55c13988452","year":2024},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.912772Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:3fe1fdbaa4e287922d2f6e63c1cfd7e0956f982eac8112306191c26f8fd00a72","observation_id":"ba92aff8-39ac-46cf-b0ce-2aa378d59444","resolution":{"observed_at":"2026-08-11T18:16:13.091228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-08-13T12:18:23.405582Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-11T18:16:12.915500Z","title":"A survey on audio diffusion models: Text to speech synthesis and enhancement in generative ai,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.915500Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:e5edd4cecb935139235dfd94f1cfcd8a8cd9638bb7046a277c21ec4f5f64b962","observation_id":"1aa292d8-1074-403e-871c-d66fb6638db9","resolution":{"observed_at":"2026-08-11T18:16:12.915500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.079685Z","title":"Diffvoice: Text-to-speech with latent diffusion,","venue":null,"work_id":"0bca6712-0a1c-49d1-8987-207be7f053a1","year":2023},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.918495Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:a98bdf1f7dca7c4b7c76d9e17d5c90c6fdd2798bcf4c7ed9f190e29bef474428","observation_id":"2dca5006-86dc-4fda-ad66-2cd78ebf63e9","resolution":{"observed_at":"2026-08-11T18:16:13.082528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-11T18:16:12.922242Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.922242Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:e3ca9a73387d53b1680cb75fc2b573df57797994d22c760b068d5a351d05a491","observation_id":"46ba7a1e-1aaf-4d62-9f4f-a52768b8babd","resolution":{"observed_at":"2026-08-11T18:16:12.922242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05011","last_updated":"2021-12-15T16:42:14Z","snapshot_observed_at":"2026-08-15T06:00:56.018391Z","submitted_at":"2021-11-09T09:07:30Z","title":"RAVE: A variational autoencoder for fast and high-quality neural audio synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05011","snapshot_observed_at":"2026-08-11T18:16:12.925172Z","title":"Rave: A variational autoencoder for fast and high-quality neural audio synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.925172Z"},"links":{"cited_paper":"/paper/2111.05011","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:77ce72b4e39a82d665aa291218460678f54606e35c90fe373d726e1c98cbb7a4","observation_id":"a5167604-be12-4ec3-8600-53b7c9ad8409","resolution":{"observed_at":"2026-08-11T18:16:12.925172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.071036Z","title":"Near-perfect-reconstruction pseudo-qmf banks,","venue":null,"work_id":"4be768ba-840a-4e3b-a9ae-ac96de82d2e1","year":1994},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.928155Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:431aa3cd6e8bba9e966ab4a86aa45902f579dd7f7d7758e8376a0f998b5652f4","observation_id":"4452742f-99ad-484f-93d4-bd6b6a6209bc","resolution":{"observed_at":"2026-08-11T18:16:13.074367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04643","last_updated":"2020-01-14T06:49:37Z","snapshot_observed_at":"2026-08-12T04:40:34.468424Z","submitted_at":"2020-01-14T06:49:37Z","title":"DDSP: Differentiable Digital Signal Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04643","snapshot_observed_at":"2026-08-11T18:16:12.931744Z","title":"Ddsp: Differentiable digital signal processing,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.931744Z"},"links":{"cited_paper":"/paper/2001.04643","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:2f7fe61a02ca44177df52426f474424f422b1c4f9db893175d3a7f9b20a7c5b0","observation_id":"9a2ae4ed-71a9-434c-be2c-6c8cfe5022d9","resolution":{"observed_at":"2026-08-11T18:16:12.931744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:12.934513Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.934513Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:6c7b3528b5fc94672b4330bdf37ebe5f99b63551cf87c6be35427b186cbe382c","observation_id":"5ac8cbd3-03e8-4a65-a23e-ce9710f0a6ec","resolution":{"observed_at":"2026-08-11T18:16:12.934513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-11T18:16:12.937149Z","title":"Diffwave: A versatile diffusion model for audio synthesis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.937149Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:4b513c9840eed10a474ca8ce429d43cbbea1b58665ab4795b1cf8c7f5b0591c0","observation_id":"8ee89e17-3e0b-44b8-9b61-b8b59403121a","resolution":{"observed_at":"2026-08-11T18:16:12.937149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:12.940666Z","title":"Denoising diffusion prob- abilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.940666Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:69e1f23786e28be4e7a3b1f9fafba7a5510372a04c74bbdb8522229f3acc3519","observation_id":"91d0d1b1-92b8-4264-a173-22593ea28d62","resolution":{"observed_at":"2026-08-11T18:16:12.940666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.053965Z","title":"Chinese mandarin female corpus,","venue":null,"work_id":"337b2810-7d25-4e27-bd24-6429884f9bd2","year":2020},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.944179Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:51d21a26e341bffed02050b1975989eb08d5e069ea16d2119f95ea26e483fdaa","observation_id":"ef073fe5-4583-4c29-bfb8-01d8622775aa","resolution":{"observed_at":"2026-08-11T18:16:13.057057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.046017Z","title":"Mel-cepstral distance measure for objective speech quality assessment,","venue":null,"work_id":"effb5a15-d3e0-4acf-bc3b-f67c776188fc","year":1993},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.946901Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:6e45b64bf7244671b44217f1c3a690dec648ec2966705997b65505be5f3a916b","observation_id":"00b0e12f-de65-47b2-a4c6-5fc694175c6d","resolution":{"observed_at":"2026-08-11T18:16:13.049135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:13.035607Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"13fdb0ae-6e7d-4cd4-9bd7-d1700e828a46","year":2001},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.949545Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:3fc122d687898936e841d6a51cb7965990d0d17eb1d75e5881c2c096b928dcff","observation_id":"e9f7d144-ad7a-433b-baf2-703df0e7e363","resolution":{"observed_at":"2026-08-11T18:16:13.040205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:16:12.952995Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:16:12.952995Z"},"links":{"citing_paper":"/paper/2412.08117"},"observation_digest":"sha256:ecd91aa4ba1b9fdd8f1b3b2b775a42da46c5ab481a249920c256fa908ea3c033","observation_id":"86cd6324-93e4-4bac-adf1-32dd78709c14","resolution":{"observed_at":"2026-08-11T18:16:12.952995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08117","last_updated":"2024-12-11T05:55:06Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T04:41:01.550373Z","submitted_at":"2024-12-11T05:55:06Z","title":"LatentSpeech: Latent Diffusion for Text-To-Speech Generation"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2412.08117."}