{"as_of":"2026-08-18T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d97e8befabbf6681b1d2bd58864b09eee3302b41140298d6102aeb96d5f9f843","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:50:14.477869Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:45:18.672137Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:45:19.541066Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2412.19259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19259","snapshot_observed_at":"2026-08-07T04:45:19.541066Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","venue":"eess.AS","work_id":"2f00520b-6b1b-470d-830b-fcaf58a790d6","year":2024},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-17T02:21:03.433032Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.672137Z"},"links":{"cited_paper":"/paper/2412.19259","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:e9fccfde453623dcaacc893be9166006b4031b8b37ea746ca1ba303cd25924a3","observation_id":"0176a76c-24a2-4bec-b123-ff19bb18f4bf","resolution":{"observed_at":"2026-08-07T04:45:19.546105Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19259/citation-record","integrity":"/paper/2412.19259/integrity","json":"/paper/2412.19259/citation-record.json","paper":"/paper/2412.19259"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.120790Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":"9ec7626c-d1c5-4b82-b573-9490d1c8e448","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.285199Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:181938eec7587e77e967e36e114d301d385f322459b42b9e6231a8d4343e055d","observation_id":"6b32beb8-aab1-4eac-bc9f-74fb71444762","resolution":{"observed_at":"2026-08-11T00:50:15.124916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.107866Z","title":"Audiogen: T extually guided audio generation,","venue":null,"work_id":"d5aed282-a831-444c-ac30-43dda219c9b0","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.290054Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:1d3a72702006945c869434a93b3611c06c65dc0cf10377c5cf9d7a6c58435105","observation_id":"094f55ab-107d-41e0-9c48-8717f5112feb","resolution":{"observed_at":"2026-08-11T00:50:15.112100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.094816Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":"31482d1a-488f-47da-ab2b-40a61691f6cc","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.294326Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:a904f90695fcf2303027e67febc3e3e8650b6c9026e29263d33217295574cbfc","observation_id":"3ad2f980-d9d0-4127-a929-4660690f676a","resolution":{"observed_at":"2026-08-11T00:50:15.099260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.081474Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model,","venue":null,"work_id":"00b3d6e6-95e7-4668-8407-5201f64eace5","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.298857Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:ce484c97d5ad9604284b263a1a24d8fdfd5f80cca3d452cba751cb5be361b60e","observation_id":"a5f91e7a-310c-4ed2-8aee-62127335f342","resolution":{"observed_at":"2026-08-11T00:50:15.085800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.068446Z","title":"Fast timing-conditioned latent audio diffusion,","venue":null,"work_id":"f919b64f-ab26-4e69-96e0-7f407be79a0d","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.303120Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:ef733ac925bf00ce200ef32ec60ca081e573b47c522a05669b170617d0156ab6","observation_id":"f7fb3555-bf53-43f4-914c-512933627bd9","resolution":{"observed_at":"2026-08-11T00:50:15.072634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.054759Z","title":"Audiolcm: T ext-to-audio generation with latent consistency models,","venue":null,"work_id":"d9960ffa-0ba8-4bab-a9ac-a4fbc8517786","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.307957Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:0f082b9e4baefa10824760be9173c945329f3c41bd68fff91fad69086eb3883e","observation_id":"5826aceb-20be-4475-9594-38094d696869","resolution":{"observed_at":"2026-08-11T00:50:15.059342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.041886Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":"616375d4-154c-4362-9c6b-af2ed56ee751","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.312383Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:06818e801c6f58a690ef061abac4f06fa8f59cc08742020f3a859f5d815ea4c9","observation_id":"96161442-fdb3-4d2c-a669-0a7587eedd84","resolution":{"observed_at":"2026-08-11T00:50:15.046238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.029116Z","title":"Grad-tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":"781419a1-49ce-491a-8049-a787e7f1dd56","year":2021},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.316352Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:cf03873ef3c9867f9596c2377ceb5d2ac2e125b2fe033a0cc3b35e465f9b4ef5","observation_id":"866bf51f-7348-4d09-b6a3-f98108cbacce","resolution":{"observed_at":"2026-08-11T00:50:15.033376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.015730Z","title":"Glow-tts: A generative flow for text-to-speech via monotonic alignment search,","venue":null,"work_id":"62c056d1-0063-4897-b630-be254f7ac3ef","year":2020},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.320357Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:cacb7545a6b80059c1cc9b66ab59aadaff9bf2a1ccc20be4e0a2b1a395745d81","observation_id":"b83ad586-66bd-442f-aa2f-57da8d966bdf","resolution":{"observed_at":"2026-08-11T00:50:15.020033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:15.002573Z","title":"Guided-tts: A diffusion model for text-to-speech via classifier guidance,","venue":null,"work_id":"ed66cc65-95aa-4275-beda-96f316b16683","year":2022},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.324155Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:705e35cd29510738d1d17678142faf7b34937587dffc3d8df3e0e2ba3fb25d6d","observation_id":"3570f116-6a1e-4efe-91f6-b6190acf802a","resolution":{"observed_at":"2026-08-11T00:50:15.007031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.989256Z","title":"Prosody- tts: Improving prosody with masked autoencoder and conditional diffusion model for expressive text-to-speech,","venue":null,"work_id":"4a1ef308-b427-4f3b-974b-8f823a5ec859","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.328390Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:112bd040c56990fa0c9a695dca1312e9e0408940d2bc12b4fca104f24ee6edbb","observation_id":"a07c7764-289b-4eb4-8d11-7ed93878560e","resolution":{"observed_at":"2026-08-11T00:50:14.993879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.975902Z","title":"Crossspeech: Speaker-independent acoustic representation for cross-lingual speech synthesis,","venue":null,"work_id":"c0c533c1-596e-4a85-b7b4-a4b5733a69ad","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.332526Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:5bf10080955beaf525c527ae7d629b4fdaacb9903df4c42fecf714f139af2c9c","observation_id":"05595412-d585-489b-a585-a3e52d1ffac4","resolution":{"observed_at":"2026-08-11T00:50:14.980344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.962763Z","title":"Fregrad: Lightweight and fast frequency-aware diffusion vocoder,","venue":null,"work_id":"dd2d7503-4c34-4d5f-bd8b-b60563d799e6","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.337405Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:c04b7a2693e2458b70848d7c141795a16f7fd8d91940ffef074f3772f93f7607","observation_id":"8d2cf736-2145-48f0-8635-ceb07a5fbd8a","resolution":{"observed_at":"2026-08-11T00:50:14.967136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.948872Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"f1582879-ad31-480a-b0c2-9dc3cf097f01","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.342219Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:cb52cb9c45bbb1dff532cff8188f08ff53516d94d90199c3038b4bcaf342d6a1","observation_id":"5a9ab71d-c656-4bb3-a954-3049b1c08c85","resolution":{"observed_at":"2026-08-11T00:50:14.953843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-08-17T23:22:26.979510Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-08-11T00:50:14.346101Z","title":"Ditto-tts: Efficient and scalable zero-shot text-to-speech with diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.346101Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:0034482439f4958f75c2062cb9a29c831a84c32c078cc2add3c7dbcd27b25ddf","observation_id":"8b8859f6-5518-4147-b656-d74c0e71beab","resolution":{"observed_at":"2026-08-11T00:50:14.346101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.935890Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"204ff26b-9a9e-427c-804d-f9bb03f3bc9d","year":2022},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.350510Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:19b21800699c5f1a337939132281fb9211fa4fe0f78675d2c22480804126cac9","observation_id":"054bde7a-7c6c-4ef6-be1c-69dc370506ee","resolution":{"observed_at":"2026-08-11T00:50:14.940192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.922144Z","title":"Score-based generative modeling through stochastic differential equations,","venue":null,"work_id":"37e98da4-a6e8-46dd-a076-17b8892d60b7","year":2020},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.354537Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:8424ef6c93425e54a30d2f75d6b942764b463b252b89023541a5675449231bc0","observation_id":"5b16b0d9-ce4a-441c-aec6-5333b0a9a7fd","resolution":{"observed_at":"2026-08-11T00:50:14.927210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.907608Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"74ba1841-f5b0-4848-8fdf-20cb5af98741","year":2020},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.358663Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:27f21b4c8d457eb92f1074b4818dec09042332950d4db0a554db2c9d2e136883","observation_id":"2f27dd73-d8ea-47e4-888a-189716c5e863","resolution":{"observed_at":"2026-08-11T00:50:14.912435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.894663Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"2d5306e9-89e9-4637-bfeb-c74457268a4c","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.362662Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:c65b8e04b3b3da1260a4f5cab303123b90e5a33d60162cfd5d469d1d189aac89","observation_id":"0dde5b27-b2bd-42bf-af60-0cb16a1b94d0","resolution":{"observed_at":"2026-08-11T00:50:14.898991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.881983Z","title":"V oiceldm: T ext-to-speech with environmental context,","venue":null,"work_id":"dfc8347b-c41a-4651-ac4f-41ff6ffb5ee3","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.366658Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:1d3851e951624401b1456a68023fb1431f083a37fb7c09301d72c95470202999","observation_id":"97ac5869-fa74-40a9-90c8-df348e62accd","resolution":{"observed_at":"2026-08-11T00:50:14.886192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T00:50:14.370607Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.370607Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:656750c1845b452ec4879efd2b89d237f8ab22c03d7d27d31aa05eb92266b390","observation_id":"61f37537-7038-4ae3-bf5a-78615cee647e","resolution":{"observed_at":"2026-08-11T00:50:14.370607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.868547Z","title":"Audi- oldm 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"088248ea-9d4a-4d54-b155-3d19aec1d393","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.374929Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:1df9a0a5418c0de5057229736fb20b280eafad6265d15931111f65e05d670e1b","observation_id":"df5d3f5d-cf88-4c99-ba04-0127df0485c3","resolution":{"observed_at":"2026-08-11T00:50:14.872832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-11T00:50:14.378957Z","title":"Uniaudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.378957Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:ab210ea204dc1c42dc0407435ee90914c719bcc1f06502bab7fe463682a6ec1f","observation_id":"a18ce097-5470-44c5-ae28-1137c2850153","resolution":{"observed_at":"2026-08-11T00:50:14.378957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.856298Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"85ecf4d1-03bb-45f5-9878-4732d17d00d6","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.383444Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:9029337d03aca3e12306bd1e65f2fba225448bc6444fdc1f7214cdcebffe9777","observation_id":"59acc64c-a9fd-4fcb-8d5f-e372abf275de","resolution":{"observed_at":"2026-08-11T00:50:14.860530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.843205Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":"0ab9d860-8147-4907-bfa1-fe765f7e591c","year":2019},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.387534Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:a1061f8ee03e33ea26d8e79d2927bf67870776e397f123c92d7c7dfc7faca1da","observation_id":"417bc99a-a84f-4c07-9d38-b7b5b5545f87","resolution":{"observed_at":"2026-08-11T00:50:14.847581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T00:50:14.391612Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.391612Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:4be354b95ebe30d259cd45aa2c1298c52da2c0595bcb724cb4ad97e0e01391bf","observation_id":"eb003fc7-c6f4-4ad0-8706-355b6141c441","resolution":{"observed_at":"2026-08-11T00:50:14.391612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-16T22:21:12.958233Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-11T00:50:14.395957Z","title":"V oxceleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.395957Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:da03255fc63a72f2883951c57a141f54318471c5d811d384572168f8e6bf11fe","observation_id":"f48a203c-1e89-48c3-af62-8f8be0893b2e","resolution":{"observed_at":"2026-08-11T00:50:14.395957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.829579Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":"ed4b0b95-9ab3-4ce1-b877-c56a268b20cd","year":2018},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.400648Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:f144e8d2aa85771e48f9b05f51bdbb978ff1d5499f3099d4018fb0e0a44759d8","observation_id":"1291cacf-1c3f-403c-b3b0-680ff8d89c55","resolution":{"observed_at":"2026-08-11T00:50:14.834321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.816260Z","title":"V oxmm: Rich transcription of conversations in the wild,","venue":null,"work_id":"10836dcd-b776-4d46-bcdb-e0f7b225e8dc","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.404600Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:80ea3e854895cb8879ef0da32163bdb5f74f6119f53f0e9dc4f3ed91651432dd","observation_id":"073bab1a-186b-4873-9d8f-be69211a50e8","resolution":{"observed_at":"2026-08-11T00:50:14.820678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.803156Z","title":"W avcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"d4c91056-01ec-4383-bbc6-1392d22ab3d9","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.408344Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:7a177e691885b34232937deb47a51f11d7ee58267148ec645a89141c53fd37bb","observation_id":"13e62add-ba5f-4567-b03b-edbb80afbbda","resolution":{"observed_at":"2026-08-11T00:50:14.807779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.789801Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":"3e540f51-5e56-43b6-9903-8ea13954c1fd","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.412656Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:99c6c25da662ec8e129cd66e1746eb0feebdb752b189424029ec50c4777a4896","observation_id":"e317840c-6275-4d3c-a7b4-45af724f4a20","resolution":{"observed_at":"2026-08-11T00:50:14.794012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.777181Z","title":"Metric learning for user-defined keyword spotting,","venue":null,"work_id":"9963159b-6f81-44c0-bb22-0db06a42feca","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.416531Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:2850e79d8f15ac73ea9fbdeeb7e220d5b81bcca008760140e8e5568af4bbeda6","observation_id":"5a5c5051-1778-4204-baf2-c1a8100db60b","resolution":{"observed_at":"2026-08-11T00:50:14.781400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.763954Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"cb971ab0-bf0a-4a92-a4ea-2f21b8293fbc","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.420471Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:74a9947313abdb3e2e6907c937a8d36aa33d40eed1c116a54cb6911b164a70e2","observation_id":"ea8cbf64-ed8d-4d1b-99b0-a6c1311caa85","resolution":{"observed_at":"2026-08-11T00:50:14.768232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.750220Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"a4926bb4-dc03-43f7-b231-5ea8221f418a","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.424659Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:45aa0c99fb4cfdff1115257d92ba32afcef161c40278d8e0879bb8ca828d284e","observation_id":"da3a4373-5002-4315-b025-6d3554c11bd4","resolution":{"observed_at":"2026-08-11T00:50:14.755313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T00:50:14.428844Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.428844Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:77b4cfd5595e3c1abb235d49298e20e3ff3ae0673a2094696aa01f8ab73abe3b","observation_id":"b67da38a-ce2c-4d72-b657-6310103773a3","resolution":{"observed_at":"2026-08-11T00:50:14.428844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T00:50:14.433279Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.433279Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:bb71e40529e8d05accb66e625fcf8632d2448ade2a15cc08d32c1edf4190574f","observation_id":"01d1a473-d10b-49d5-829f-0ee88de9051c","resolution":{"observed_at":"2026-08-11T00:50:14.433279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.736996Z","title":"Attention is all you need,","venue":null,"work_id":"9fa63f16-a1a9-4d20-ab17-295cac46c07d","year":2017},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.437550Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:232593186fe08d0196b6250b7ca8e62b0b7ab974ed1245820488c698cb937f08","observation_id":"27796288-61a8-4e45-9c4b-e705bfd00286","resolution":{"observed_at":"2026-08-11T00:50:14.741388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.723040Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"2c1803a9-3fa3-4720-b779-a060a2a3c1c6","year":2018},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.441705Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:9bd6121d2e4d830cb21efbc4ecaee04513ad42ed2b2e9537c3759cd21db0fda4","observation_id":"7f9b4b55-19c7-44e7-bb70-2f55a367775e","resolution":{"observed_at":"2026-08-11T00:50:14.727942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.709719Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,","venue":null,"work_id":"dcbbad02-bbf6-4427-b783-9027be87bdec","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.445594Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:469ee56e104ab75b36ec09a8fd2a1d443cae47a6120b8a2f00f1876d25117a3d","observation_id":"88288ab1-4d2f-4530-916b-5ed8639edebf","resolution":{"observed_at":"2026-08-11T00:50:14.714049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.696303Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"cb413a6c-00b2-4cb8-a2ba-232a18736791","year":2021},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.449576Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:46b8148b97ac78b1f5f5c49c024a4c7196080479e62eb7fd25d1fb130377fc5b","observation_id":"1c70662f-3fda-493c-9a53-3376fb623a9c","resolution":{"observed_at":"2026-08-11T00:50:14.700597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.682308Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"96b871f4-fe89-4044-8418-63936ef503c5","year":2020},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.453543Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:4dba2d426e8cdec93e26678d4f73e9fb7be86cd1ee0f14c3688d2808f203f958","observation_id":"8e850ab3-abff-44bd-b0cb-c6e4e8a0759c","resolution":{"observed_at":"2026-08-11T00:50:14.687058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.667990Z","title":"W avlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"b59f9532-2acc-4200-86c1-871581b63aa1","year":2022},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.457609Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:33c6cfdd14daa68c6f507beef868d81dacc0a0b8f21e91fce3d820faaf14eacf","observation_id":"325ff93c-b15e-402e-ae75-a33f32770a4e","resolution":{"observed_at":"2026-08-11T00:50:14.672277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.653987Z","title":"Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,","venue":null,"work_id":"c6ad877b-f1e9-4be9-a1b5-b5a688b6aadf","year":2024},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.461602Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:a5ea8fa8fdb0eeb9706a3f21913a5c2cb7952892d2b22578ad07c785aab768a7","observation_id":"92de90e0-cda9-4b98-97db-384300238ca1","resolution":{"observed_at":"2026-08-11T00:50:14.658468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.639512Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"cb345ea8-a210-46e7-9965-bb98bff9e07f","year":2017},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.465673Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:1fa6516a75f76c61ae58f030f40553926509014edbe18b47d2a5dc98711d4bd1","observation_id":"d0e2697d-9dc6-444d-be79-6328668b6409","resolution":{"observed_at":"2026-08-11T00:50:14.644247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-11T00:50:14.469689Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.469689Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:7f253333d971f45e7177d8f206e4a4a6997f58c3867dc5fa31d33b3b989aafe0","observation_id":"c405fef8-c725-4275-a956-6b3578d0e8b1","resolution":{"observed_at":"2026-08-11T00:50:14.469689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.626096Z","title":"I hear your true colors: Image guided audio generation,","venue":null,"work_id":"09ba7853-2c7a-4045-b651-8d65f43c32d7","year":2023},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.473809Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:74b8e47ebfa2f504a0a5ea77916a227c1f075cc51e3a30642ae432a57609d121","observation_id":"8aff6a2c-f666-456c-bdb0-52c603beb41d","resolution":{"observed_at":"2026-08-11T00:50:14.630750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:50:14.610519Z","title":"T aming visually guided sound generation,","venue":null,"work_id":"a7bac54d-7fce-4980-8b02-ebb2839b97ff","year":2021},"citing_paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T00:50:14.477869Z"},"links":{"citing_paper":"/paper/2412.19259"},"observation_digest":"sha256:6c41cab008ac8f7e9488f6ab908f6a1d923d407a2f6b0b4c507e348494685532","observation_id":"a1446cfc-b7be-493a-b313-a8e7e3f96f16","resolution":{"observed_at":"2026-08-11T00:50:14.616648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.19259","last_updated":"2024-12-26T15:52:58Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T13:26:50.412745Z","submitted_at":"2024-12-26T15:52:58Z","title":"VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2412.19259."}