Pith. sign in

Paper Citation Record · LEDGER

WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2406.05763.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.05763 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 13 of 13 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 13 of 13 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T04:46:23.368773Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T12:19:49.635938Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 138ad91b-1082-4925-afe0-dcdaae9df868 · inbound

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching cites this paper.

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 123

Resolution
verified exact
arxiv_id, observed 2026-05-16T06:06:41.458352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-16T06:06:41.348728Z digest=sha256:c12c4c99cc5acc3924d72e4c4a4de0831b59aa531d3c4d558ed02b2028a0e79f

Observation 8198aee0-864b-4a99-aae9-39ad1aece243 · inbound

The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024 cites this paper.

The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024 WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-12T04:46:23.368773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:46:23.368773Z digest=sha256:6dd569ce4173c423f53d0e71a07056b4aeb1446ef0ebb78373b35314cd21e2d7

Observation 7ff573cb-2288-4695-b7ec-d0720a700774 · inbound

TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch cites this paper.

TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T11:18:33.526727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:18:33.526727Z digest=sha256:58463dce4201acc2d901f37b88fc5cba193188cebf1507ab1d84ca8d376a173b

Observation b5f64cc5-3f35-438e-ac87-c9d6ef9c416b · inbound

Kimi-Audio Technical Report cites this paper.

Kimi-Audio Technical Report WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:21:27.272896Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-11T19:21:26.933349Z digest=sha256:c87f3f84285d356de5748a705f9b5ce20e2d60fffd594aed86d1a53aef33a08e

Observation 30bb3cbe-ee07-4b8c-98c1-e66a3eca2135 · inbound

UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information cites this paper.

UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:53:16.449290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:53:16.449290Z digest=sha256:495c7f0e5430c32aaa4a0d2dd3c46c60496a98152b5f8860a1d6b3b316b63f94

Observation 67f74920-be81-43fe-a871-d1ab29ffa4bb · inbound

MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition cites this paper.

MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T11:02:26.135591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:02:26.135591Z digest=sha256:9d05a33371f326d4840e978f9802e60f05e54c13ecb54cd545b6f72119cc6024

Observation f5a86135-f78e-4daf-8f2e-11ed8cd36458 · inbound

Adaptive Duration Model for Text Speech Alignment cites this paper.

Adaptive Duration Model for Text Speech Alignment WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T11:34:09.630347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:34:09.630347Z digest=sha256:0af5453cf2162b32ae56726fdd4d634d09c8c16c3a58b3c3a08c3ed6fd8e861a

Observation f022607e-521b-434f-afbb-449dca63c080 · inbound

VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing cites this paper.

VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 116

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T04:50:56.139824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-11T01:03:09.942984Z digest=sha256:09307f41926db8dc763b562e1f1a5929d8075d9dd41e4440bf7f84c587b624cf

Observation b737ab51-4b48-4e0b-ad2d-e47b00678ded · inbound

FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation cites this paper.

FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-07-03T03:27:36.184168Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-27T15:15:10.060770Z digest=sha256:8bd30aa4238fa544c4324ea41196be28f77c4445242b0b5392cc510335584748

Observation ed7d087d-a2d1-4db7-9c99-5a4dbbd044ae · inbound

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech cites this paper.

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-07-04T12:19:49.637490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T07:02:36.499424Z digest=sha256:20cd00aea06cfa09aba85411efe3751ec80bc9b3f47bdf4dc37e6d21cda197fb

Observation 1315673f-b59b-4c4b-b380-2768e3b7aad5 · inbound

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech cites this paper.

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 44

Resolution
unresolved
no resolver link, observed 2026-07-12T12:44:20.831164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T12:44:20.831164Z digest=sha256:b54ec939825d6ea22300aeb114f053439aff73d5a61557ef6b8a28a870ebd3b5

Observation 83f0598a-d331-4df4-ac54-890ddc2508a6 · inbound

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision cites this paper.

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 167

Resolution
unresolved
no resolver link, observed 2026-08-01T11:43:06.508576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T11:43:06.508576Z digest=sha256:252cde2d9100b6fba16f44ae922ba6fe7a8bd41b730fb325648c895d044ed8ad

Observation c48be3ba-81f7-48be-9750-925325d18207 · inbound

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation cites this paper.

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-10T04:20:41.870923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T04:20:41.870923Z digest=sha256:1061654c258cbe29b14b7abf37bd62de45f681e141d43eb36a35a7079aed07bc