Pith. sign in

Paper Citation Record · LEDGER

A Non-autoregressive Model for Joint STT and TTS

As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.09104.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.09104 v2

Coverage vector

measured 38 of 38 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T20:15:28.530654Z

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

38 of 38 outbound references displayed

  • verified exact3
  • verified fuzzy11
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 19382c3b-43d4-4f07-a5f9-f554ba6d7e2f · outbound

This paper cites Almost unsupervised text to speech and automatic speech recognition,.

A Non-autoregressive Model for Joint STT and TTS Almost unsupervised text to speech and automatic speech recognition,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.158504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.346059Z digest=sha256:f1c61966b0d1380379eef57978e580a14c282d39604a4e96794ebaaac5d5f934

Observation 1cbe7a3b-e633-4f52-b960-bb91073d34ee · outbound

This paper cites Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,.

A Non-autoregressive Model for Joint STT and TTS Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.143256Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.351495Z digest=sha256:319574f101edf26f46e4d5bea87d2c03d3fa27073c94eaea1d4877ad2a06efc4

Observation ce8b6928-7725-4f9a-ad72-f4fcab158215 · outbound

This paper cites LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT.

A Non-autoregressive Model for Joint STT and TTS LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.356241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.356241Z digest=sha256:a10986697fa65403c9b74bd1a5275ff2641d30db19e5bae42e489788747c3eec

Observation e745e0e5-a8ee-4a6a-bcf3-0b8162d14bab · outbound

This paper cites SeamlessM4T: Massively Multilingual & Multimodal Machine Translation.

A Non-autoregressive Model for Joint STT and TTS SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.361491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.361491Z digest=sha256:95f43b096c52f00a4c0d25ea75632ccada386602cd85286656108fede1a1370c

Observation 986c61e3-f5ce-4887-9e99-81673de043b5 · outbound

This paper cites SpeechVerse: A Large-scale Generalizable Audio Language Model.

A Non-autoregressive Model for Joint STT and TTS SpeechVerse: A Large-scale Generalizable Audio Language Model

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.366374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.366374Z digest=sha256:a27b0a14f71198a0a5fb3270fb9b9e1d5f74d4c3ad7899837562685e730b4eea

Observation 5070c066-6467-47c6-9d22-90b4fb84ef2b · outbound

This paper cites Viola: Conditional language models for speech recognition, synthesis, and translation,.

A Non-autoregressive Model for Joint STT and TTS Viola: Conditional language models for speech recognition, synthesis, and translation,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.127478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.371562Z digest=sha256:75500aeda1fd8423bea058f3d9eebe5de9555c23c951c42f228e50e9153d1154

Observation 210853eb-d742-4853-9626-2bc877e506f7 · outbound

This paper cites FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs.

A Non-autoregressive Model for Joint STT and TTS FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.376868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.376868Z digest=sha256:b0858c9ae0974559e928aa2366fbc091077d2e3829151ae7625a033f7131ccd1

Observation e92e1ccd-e614-476f-b7f5-bd0aca3b7af6 · outbound

This paper cites OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification.

A Non-autoregressive Model for Joint STT and TTS OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.381704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.381704Z digest=sha256:ae91c146457d1898a01313dd10a858acec983dea0df5fd0a3fa085aea9b0befe

Observation e185ac2e-fefd-4400-94fb-57479b7a0087 · outbound

This paper cites Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,.

A Non-autoregressive Model for Joint STT and TTS Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.387144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.387144Z digest=sha256:55ee9c3997d1b38f429d9e914cd8bd433c5a7ca553f37d49e5b04bfdf7f22597

Observation 9d7e56b1-3251-4f64-8795-59b5b151f0e1 · outbound

This paper cites Fastspeech: Fast, robust and controllable text to speech,.

A Non-autoregressive Model for Joint STT and TTS Fastspeech: Fast, robust and controllable text to speech,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.391635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.391635Z digest=sha256:874fefddaf124090034cb188cbbeb85a9353825cbf79970ce78dc90825ae6231

Observation 9135e5b5-2be5-4f6a-9626-61a1d0b3309e · outbound

This paper cites Joist: A joint speech and text streaming model for asr,.

A Non-autoregressive Model for Joint STT and TTS Joist: A joint speech and text streaming model for asr,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.090188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.396298Z digest=sha256:9c2963a81a7a63a1bdf294b27670bc640c0ddb2f77647fd90550969ec5404597

Observation f8c5f476-a811-4f5a-a647-fdfd02816f7a · outbound

This paper cites Integrating text inputs for training and adapting rnn transducer asr models,.

A Non-autoregressive Model for Joint STT and TTS Integrating text inputs for training and adapting rnn transducer asr models,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.074509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.401786Z digest=sha256:ac619ca3a28d1d2cce5e5550b5df381ab8269edbd28d5c9d02b847a7ef916b3d

Observation 3c595c02-b884-4bc0-8e2e-5249f72347bb · outbound

This paper cites Semi-autoregressive streaming asr with label context,.

A Non-autoregressive Model for Joint STT and TTS Semi-autoregressive streaming asr with label context,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.057689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.406510Z digest=sha256:6a0c9f39077eb09597b392615b97233ebdd15ddb323a0d27d124464929c55251

Observation c82be303-93f6-488a-b8f6-e55b71a57ae6 · outbound

This paper cites Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment.

A Non-autoregressive Model for Joint STT and TTS Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:15:28.760841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.411135Z digest=sha256:bc3aa7b5ae3471c769b66055a90bd082f6e995d05ca1892fbc5d579613f5e41a

Observation 6d57ffeb-8354-48c8-b6a0-a6e84ac19d02 · outbound

This paper cites Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict.

A Non-autoregressive Model for Joint STT and TTS Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:15:28.738910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.416162Z digest=sha256:0390e4ac4ec1e99bb8c03d8c409ee7fb06e5fea261e21382553b43e8ba9901b9

Observation a5baa8fd-78f8-46dc-bc2c-7badce02f133 · outbound

This paper cites BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model.

A Non-autoregressive Model for Joint STT and TTS BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:15:28.715509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.421118Z digest=sha256:57176c6f77c4e29a34c532da3a89ea635e42edd7388d280e8a5ace4a026549df

Observation 2e82dfc9-12b7-4d54-9ae0-f774b1688393 · outbound

This paper cites Bectra: Transducer-based end-to-end asr with bert-enhanced encoder,.

A Non-autoregressive Model for Joint STT and TTS Bectra: Transducer-based end-to-end asr with bert-enhanced encoder,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.040118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.426110Z digest=sha256:9e48a52acab975700fc3977607b855fbc3739a6c74f654a0f1f7de04a99e56ff

Observation 52ffb3d8-360b-4cb8-bd8d-dddbaa6cada6 · outbound

This paper cites Mask-conformer: Augmenting conformer with mask-predict decoder,.

A Non-autoregressive Model for Joint STT and TTS Mask-conformer: Augmenting conformer with mask-predict decoder,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.022217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.430810Z digest=sha256:361f7cd74656d8fd0398041e42cf71f5f5f939a6867167efb9e7fec8d453109b

Observation 5e40e57e-16cc-46c1-93a4-c962b429327d · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations,.

A Non-autoregressive Model for Joint STT and TTS wav2vec 2.0: A framework for self-supervised learning of speech representations,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.435399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.435399Z digest=sha256:aef3f1e156d266caf3a0041ccc77a71ce10591ebbdadaedec189891aad3fcad2

Observation afc07b86-e777-44ab-b611-e14c315d9f89 · outbound

This paper cites Layer normalization,.

A Non-autoregressive Model for Joint STT and TTS Layer normalization,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.440501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.440501Z digest=sha256:569195107d64d6569d828965257e3c2b62b7253146aed8fbc8157ca1fd63d2e9

Observation 7279e4c5-b81f-4fdb-b014-702de35ec5c3 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

A Non-autoregressive Model for Joint STT and TTS UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.445462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.445462Z digest=sha256:3c496d342d71f2111aabffc58082b4397852daaff97d59f88e7d0b21f20740f1

Observation 3d529b1a-5af5-4d0c-a21c-e91333cc6ae9 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

A Non-autoregressive Model for Joint STT and TTS Robust speech recognition via large-scale weak supervision,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.450541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.450541Z digest=sha256:05b0140ef6ae15d8e4505c110f286ad888a7c4f7fe4a97f8d362aa4f863f0f6e

Observation 82b3c130-1de6-46c1-aa51-3fb9b5a1f987 · outbound

This paper cites ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models.

A Non-autoregressive Model for Joint STT and TTS ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.455695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.455695Z digest=sha256:e4b59fd9945c9086694a91080b37d108768bb42daf6e3f45106a506f44279815

Observation 96cce75b-7029-453f-9f93-4549ae9cf4fe · outbound

This paper cites The lj speech dataset,.

A Non-autoregressive Model for Joint STT and TTS The lj speech dataset,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:28.967736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.460414Z digest=sha256:536fe74d99a39f54574cc5216d866cb1c9f6fa21632aca01891033fb61c4902f

Observation 348305b0-a045-4aff-8f80-e15c448bc940 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

A Non-autoregressive Model for Joint STT and TTS LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.464814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.464814Z digest=sha256:a9cdeaf1a6a1cae7e4025bd787d9be0147620f657404b4daa581e1e4cd860b21

Observation 442bc79f-1de7-4d20-913a-e655ee78199b · outbound

This paper cites Librispeech: an asr corpus based on public domain audio books,.

A Non-autoregressive Model for Joint STT and TTS Librispeech: an asr corpus based on public domain audio books,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.469522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.469522Z digest=sha256:c90de009a4b0823fa2b069367e43ddff81c69db64b8663e2f8827d4fe5615a7e

Observation 7a0bd6be-8bba-440d-92d7-eeb78616a12b · outbound

This paper cites LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus.

A Non-autoregressive Model for Joint STT and TTS LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.474447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.474447Z digest=sha256:7c0fff5b111c6bd2e8073f922cede409fba5cf76674974514c39f8a65e523420

Observation dba533ba-213b-44b6-b407-465ed4750d52 · outbound

This paper cites Conformer: Convolution-augmented Transformer for Speech Recognition.

A Non-autoregressive Model for Joint STT and TTS Conformer: Convolution-augmented Transformer for Speech Recognition

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.480440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.480440Z digest=sha256:a78b1e080b31e31e94bb89c25baee1c909ef493ac5272bf0ab2cf7d4ed03bbb2

Observation 18d15006-6a65-46be-87ac-9ce3b30c07ba · outbound

This paper cites ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification.

A Non-autoregressive Model for Joint STT and TTS ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.485951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.485951Z digest=sha256:10090fef23b1f6969b92aba3b01a2c67ab9bcb73cb93b3671bd88e25e7d4acd6

Observation 60d7cb1f-ff83-4449-a370-e8cf45f47c44 · outbound

This paper cites Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,.

A Non-autoregressive Model for Joint STT and TTS Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.491768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.491768Z digest=sha256:9166246740a7171d4a1890873b4cc4ceaa3c7cefd7c0acbfb414a48a7ec2291c

Observation 7701a5c4-ff0c-4c81-bba2-b716a10662c7 · outbound

This paper cites SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition.

A Non-autoregressive Model for Joint STT and TTS SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.496296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.496296Z digest=sha256:cab3d92cee66a6f891a9ac10a3e139e944220d01cc41eb22665a386bda2e8a33

Observation 580a110f-fe7f-4fd9-9ad7-f31e81b52e7c · outbound

This paper cites Audio augmentation for speech recognition.

A Non-autoregressive Model for Joint STT and TTS Audio augmentation for speech recognition

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.500917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.500917Z digest=sha256:fba5ca1dc7eb5eaf72e9be5ab8f12d7a34d04f48229691d5cd70277fe26a5df2

Observation a30e41ff-9fd7-4bbd-a147-5d29be044c01 · outbound

This paper cites Super-convergence: Very fast training of neural networks using large learning rates,.

A Non-autoregressive Model for Joint STT and TTS Super-convergence: Very fast training of neural networks using large learning rates,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.506312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.506312Z digest=sha256:75220c552957306d89b171fb0e5f591de27060224e5f1d96f9eaa9d4ed02793e

Observation d0fdf2ab-b8e7-4cb6-b0e6-66a6fa579f6f · outbound

This paper cites Rethinking the inception architecture for computer vision,.

A Non-autoregressive Model for Joint STT and TTS Rethinking the inception architecture for computer vision,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.510887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.510887Z digest=sha256:818562c119f4f135ffe692805286123bb5d666ea12500cb6884b088320817df2

Observation f4c980a6-9f46-484e-95ff-654787756f49 · outbound

This paper cites Regularization of neural networks using dropconnect,.

A Non-autoregressive Model for Joint STT and TTS Regularization of neural networks using dropconnect,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:28.891532Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.516216Z digest=sha256:e937d76b6c900741e7fdeba00d95062bb88a52421346a5689bdc96bf327d784d

Observation 004df12f-cf94-43a1-b93f-989747bbc029 · outbound

This paper cites Sequence noise injected training for end-to-end speech recognition,.

A Non-autoregressive Model for Joint STT and TTS Sequence noise injected training for end-to-end speech recognition,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:28.873661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.520889Z digest=sha256:18c9640fb2f70c3620998e6d6e3ffd6dcf7530bffac7fa8120895b66bacb83d1

Observation 9a06238f-8bab-4481-971b-91cb02c8bc78 · outbound

This paper cites Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions.

A Non-autoregressive Model for Joint STT and TTS Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.525732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.525732Z digest=sha256:19cdc8af1962a3c52c1b27db2fd0ccbb03a6e142e1d0080f42dc0e01e6a7c2bf

Observation 25f1d255-6d72-4087-87ff-f4a4ff22e5fa · outbound

This paper cites FastSpeech 2: Fast and High-Quality End-to-End Text to Speech.

A Non-autoregressive Model for Joint STT and TTS FastSpeech 2: Fast and High-Quality End-to-End Text to Speech

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.530654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.530654Z digest=sha256:ed355b04c13a9d80a0feda37dd5f549de81cde505a61c54e55df6f89ec447b58

Pith citing papers

No inbound Pith citation observations are available.