{"as_of":"2026-08-08T23:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53cc1b4ff98a1529464b4d6ff441ae2df1cb6ac09db867235df16cee949827f5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:30:34.140760Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:50:11.241591Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T15:30:34.140760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14910","last_updated":"2025-05-30T10:20:59Z","snapshot_observed_at":"2026-08-07T23:08:37.820059Z","submitted_at":"2025-05-20T21:04:10Z","title":"TCSinger 2: Customizable Multilingual Zero-shot Singing Voice Synthesis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:30:34.140760Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2505.14910"},"observation_digest":"sha256:d09dcb3a96dab4ccd4922bf8381514b7177299690e24c010a5b1cfebc4ebe6fc","observation_id":"cdbe0ec9-7038-4163-a31d-7bc3d19ebd5f","resolution":{"observed_at":"2026-08-07T15:30:34.140760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T13:16:16.366580Z","title":"Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-07T13:08:42.493745Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.366580Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:898f4a2437aa780d11af2671420683c50cfc9b0ab299eaece64c461249b4cfd1","observation_id":"587953c3-962d-4b96-8ae5-507bfbef7791","resolution":{"observed_at":"2026-08-07T13:16:16.366580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T11:57:55.278735Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.278735Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:0ab648c8a52f241f30ed95640084a5fb3bac0c7397d7ceadd207a3ea8df58775","observation_id":"099d9eb2-9a58-43c6-b9b0-a7be49a96e24","resolution":{"observed_at":"2026-08-07T11:57:55.278735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T00:46:39.196042Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2506.23552"},"observation_digest":"sha256:ee76640419c4b2caa8853c4cbb3da04f3a0314567cc3585f386405847b2b6afa","observation_id":"f6bd46b6-78ae-4182-87a8-0c239981490a","resolution":{"observed_at":"2026-05-22T00:50:51.053768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2507.01936","last_updated":"2026-04-18T01:22:19Z","snapshot_observed_at":"2026-07-06T21:51:14.737439Z","submitted_at":"2025-07-02T17:46:56Z","title":"The Thin Line Between Comprehension and Persuasion in LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T06:05:44.600781Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2507.01936"},"observation_digest":"sha256:c2b65c3a20edba576bfdddf1fa702e30dcd522c4ada107d610ebef92b40ca8c8","observation_id":"03cecab6-b8f0-4506-8765-6f7727eddc1e","resolution":{"observed_at":"2026-05-19T06:07:07.323651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-06T18:16:10.849757Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08983","last_updated":"2025-07-11T19:35:29Z","snapshot_observed_at":"2026-08-06T18:05:14.367192Z","submitted_at":"2025-07-11T19:35:29Z","title":"Exploiting Leaderboards for Large-Scale Distribution of Malicious Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:10.849757Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2507.08983"},"observation_digest":"sha256:883c2fbb9b816fbe0a080b344220523f57089e8e3894187335b2f1e79e711951","observation_id":"a800ec70-a113-4f3c-8d23-8a6a1ba1b0f0","resolution":{"observed_at":"2026-08-06T18:16:10.849757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-06T13:14:37.524679Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20880","last_updated":"2025-07-28T14:34:02Z","snapshot_observed_at":"2026-08-06T16:37:02.345788Z","submitted_at":"2025-07-28T14:34:02Z","title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T13:14:37.524679Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2507.20880"},"observation_digest":"sha256:253ee5b99d2bd2899751c1838cec0ce499be90ea682a13497078bf94d5344031","observation_id":"693a491d-ead1-4089-a240-50699ac46ec3","resolution":{"observed_at":"2026-08-06T13:14:37.524679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-05T16:21:56.269739Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18701","last_updated":"2025-08-26T06:08:17Z","snapshot_observed_at":"2026-08-06T22:03:25.831250Z","submitted_at":"2025-08-26T06:08:17Z","title":"Attention2Probability: Attention-Driven Terminology Probability Estimation for Robust Speech-to-Text System","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:21:56.269739Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2508.18701"},"observation_digest":"sha256:157db84ca9d3822fcd783cf122db38e5141b7c85ca1b0a67bbfecab78d0d4a60","observation_id":"c783b992-901b-485c-ae29-8d885f5d5cd6","resolution":{"observed_at":"2026-08-05T16:21:56.269739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-04T19:11:59.530961Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09748","last_updated":"2025-09-11T12:32:08Z","snapshot_observed_at":"2026-08-08T07:23:28.359307Z","submitted_at":"2025-09-11T12:32:08Z","title":"DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T19:11:59.530961Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2509.09748"},"observation_digest":"sha256:2a171208cc89e027b054d2ae661617137ece8bb6494c66437b5c2f81d5de3bcf","observation_id":"7dd14df9-6bc9-44e4-a47a-e65792cea62a","resolution":{"observed_at":"2026-08-04T19:11:59.530961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-04T11:29:32.995304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.995304Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:aeb75dc462c3eea7d318b6c7873b6ddba7264527d3ecce961c2b3457a537d17f","observation_id":"e4ed716a-13e0-4bc3-a677-661395c9a330","resolution":{"observed_at":"2026-08-04T11:29:32.995304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:bd8862d5aee9e7580f6447795f4ce5dee0db1f32c40255fb08045f4577aa2414","observation_id":"9625e5cf-2220-4ca0-8e39-cb1d27fd56b5","resolution":{"observed_at":"2026-05-13T23:03:24.776569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:0b46968b6f340fdc87fabdf862319b67a503480460ae941caf3869d9d4580870","observation_id":"1662e086-ac3a-4e49-a673-016f13136596","resolution":{"observed_at":"2026-05-11T08:30:57.172616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Megatts 3: Sparse alignment en- hanced latent diffusion transformer for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:5463126031f9bb59b169671a8a9714ac617b58ded427323dd9d340ebea6f2948","observation_id":"a4c39120-64ca-43b2-befd-ce6d88be8442","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2604.12292","last_updated":"2026-04-14T05:03:57Z","snapshot_observed_at":"2026-08-06T05:09:28.270784Z","submitted_at":"2026-04-14T05:03:57Z","title":"CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:58.010112Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2604.12292"},"observation_digest":"sha256:1edbb8c45e718cd5adb33ba479235a7dcc250a6d2c3c5563883b3e5741954cd1","observation_id":"04768d21-8e5a-4997-9c49-9a26dedad9ca","resolution":{"observed_at":"2026-05-11T09:51:00.828282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2604.13067","last_updated":"2026-03-19T21:12:49Z","snapshot_observed_at":"2026-08-05T17:09:57.300771Z","submitted_at":"2026-03-19T21:12:49Z","title":"From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T07:59:22.416259Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2604.13067"},"observation_digest":"sha256:d86bd2d1268d19a0a2adaafd0f8efbf5e826d22d6c2fc576b7882e2386571ebb","observation_id":"4099f967-69ac-4231-b82a-512ba525982c","resolution":{"observed_at":"2026-05-15T07:59:50.716425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T02:56:06.910758Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:532dc0c6ddb2d21dbf5eb52d4b6308849b798958fa674aeb3983d40db5a6823c","observation_id":"2590a872-a3f4-425c-86d7-f6e915558813","resolution":{"observed_at":"2026-05-22T03:00:58.998461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-02T13:29:53.318898Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-02T13:29:49.967308Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.318898Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:19bc294c2d25f8f4fbb1b61bc0b4d37cdacc7c702a3f9408583273680700570b","observation_id":"3ad9fbba-a588-4172-919f-eb6559d93ab0","resolution":{"observed_at":"2026-08-02T13:29:53.318898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:bcab46188aca116c617c69140f451018b411fd86ffb2df6318d329859c665bc9","observation_id":"f700083f-6c0b-4c7d-afe0-7f7c12ce8eba","resolution":{"observed_at":"2026-07-01T20:26:13.109018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:bbbf8589e90081031f30423accff388ec39bb2164c33cbd4d531e096102e3bb6","observation_id":"768e4f15-4a57-45e2-adb1-22e3139c3de8","resolution":{"observed_at":"2026-07-02T05:16:39.706809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:20a0ec73e8e58e8e000b3b7fc732265cff5d7ea666a7753fc1f7fdb86d200131","observation_id":"111fa7d6-a449-4200-a13e-c0646cbd6737","resolution":{"observed_at":"2026-07-02T19:47:19.748586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.07080","last_updated":"2026-06-05T09:19:24Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:19:24Z","title":"dots.tts Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:10:25.911203Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.07080"},"observation_digest":"sha256:9fbd3320203cc814f2339eca00e874d0cd2a1d7ec68bd0f275579078461c5135","observation_id":"d62cfc91-7398-45ee-acda-3dc9648f1de1","resolution":{"observed_at":"2026-07-02T19:57:20.051412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.18323","last_updated":"2026-06-16T15:41:44Z","snapshot_observed_at":"2026-08-06T02:49:06.057401Z","submitted_at":"2026-06-16T15:41:44Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T22:46:47.786929Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.18323"},"observation_digest":"sha256:87f495c5626597feeec8332fdacee2ea040b50cf277f8e1d7ff77970f34360d1","observation_id":"6ee9bf96-8091-4db3-a043-d2fa1fc3cf9b","resolution":{"observed_at":"2026-07-03T23:19:02.929572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.19325","last_updated":"2026-06-17T17:51:50Z","snapshot_observed_at":"2026-08-03T14:31:26.558590Z","submitted_at":"2026-06-17T17:51:50Z","title":"Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T19:04:25.542629Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.19325"},"observation_digest":"sha256:70038ba3163e5e9addafbb479f6ae0fc937438a0d1662aeeb2a785e9c73da89e","observation_id":"2bcc5c2b-2ddf-4239-a728-12ede820e97e","resolution":{"observed_at":"2026-07-04T02:49:24.876078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.20650","last_updated":"2026-06-08T06:54:55Z","snapshot_observed_at":"2026-08-02T23:08:38.292740Z","submitted_at":"2026-06-08T06:54:55Z","title":"EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.972071Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.20650"},"observation_digest":"sha256:5773f4aac435702508abd91ae9ef1b055b47798cdd5e6309d8086f75fbd722c6","observation_id":"9ab8c22f-96c7-43be-8eaa-9bd5e66b0d74","resolution":{"observed_at":"2026-07-03T00:47:30.566017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.25672","last_updated":"2026-06-27T02:44:46Z","snapshot_observed_at":"2026-08-03T14:31:28.705004Z","submitted_at":"2026-06-24T10:34:27Z","title":"Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T19:35:52.631543Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.25672"},"observation_digest":"sha256:bba368b957c81e69ff0202d3785b3c1cc95e5ad178542a0676b2bcb98a2f05d9","observation_id":"910e558f-fe07-4e39-b823-61df4e107646","resolution":{"observed_at":"2026-07-04T20:50:11.243408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2502.18924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-04T20:50:11.241591Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":"f8eeb7b9-5205-4a23-ac54-4bc5d136791e","year":2025},"citing_paper":{"arxiv_id":"2606.25672","last_updated":"2026-06-27T02:44:46Z","snapshot_observed_at":"2026-08-03T14:31:28.705004Z","submitted_at":"2026-06-24T10:34:27Z","title":"Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T10:07:48.053378Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2606.25672"},"observation_digest":"sha256:01e7d5090cbe71d89c9aca4499a38b22e1e7db7be32c1e796e9a78ec0a381d65","observation_id":"763bbe90-8755-42a1-9e6e-4e16b0463491","resolution":{"observed_at":"2026-06-30T12:44:40.076521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-12T02:38:17.163398Z","title":"arXiv preprint arXiv:2502.18924 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03418","last_updated":"2026-07-03T15:27:17Z","snapshot_observed_at":"2026-08-08T18:53:28.153439Z","submitted_at":"2026-07-03T15:27:17Z","title":"DETECT-3B-Omni is Agnostic of Content and Demographics","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-12T02:38:17.163398Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2607.03418"},"observation_digest":"sha256:d9abfd7b214311a3f8bcf123bb9b193b349cc789f187c9ba3f3e2965120656af","observation_id":"4d72292d-bc6e-491b-a2d7-affa35327ce3","resolution":{"observed_at":"2026-07-12T02:38:17.163398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2502.18924 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-08-07T15:40:45.553118Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:932ca9acee41aba7b005292c5cf5b8773dd33e3dbc464c98fdf6af5d2fe9bec8","observation_id":"966fa3d7-be6a-434e-9f6b-365d6f941014","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-04T02:47:36.903349Z","title":"MegaTTS 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech syn- thesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:36.903349Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:c65774ebbd728a5fa02502d9a461bdee49fa4aceb719ea0efcd8210b62512f6e","observation_id":"1562ad06-8805-48b2-a8ad-4d7b16698ae6","resolution":{"observed_at":"2026-08-04T02:47:36.903349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-04T16:29:23.503407Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:23.503407Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:2a12dd2d26600d2b478cafe4ba59b34a90190ad1a62edab973ba85824b28a76a","observation_id":"5f8c3cba-3765-47a0-b2de-46647600cdaf","resolution":{"observed_at":"2026-08-04T16:29:23.503407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T00:14:44.716159Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:44.716159Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:65fc803f41ab4a5b8559d90627bd08458ee517f8022697fb0f6c66c5b4b7ba36","observation_id":"bf3d068e-ceb0-4675-abbf-063188f005fa","resolution":{"observed_at":"2026-08-07T00:14:44.716159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.18924/citation-record","integrity":"/paper/2502.18924/integrity","json":"/paper/2502.18924/citation-record.json","paper":"/paper/2502.18924"},"outbound":[],"paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","latest_version":4,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2502.18924."}