Pith. sign in

Paper Citation Record · LEDGER

A Non-autoregressive Model for Joint STT and TTS

As of 15 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.09104.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.09104 v2

Coverage vector

measured 38 of 38 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T20:15:28.530654Z

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

38 of 38 outbound references displayed

  • verified exact3
  • verified fuzzy11
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 19382c3b-43d4-4f07-a5f9-f554ba6d7e2f · outbound

This paper cites Almost unsupervised text to speech and automatic speech recognition,.

A Non-autoregressive Model for Joint STT and TTS Almost unsupervised text to speech and automatic speech recognition,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.158504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.346059Z digest=sha256:c8b1c35ed6f4576e0abb4c01442fba909589bcd41ae9db21f47181d82224a052

Observation 1cbe7a3b-e633-4f52-b960-bb91073d34ee · outbound

This paper cites Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,.

A Non-autoregressive Model for Joint STT and TTS Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.143256Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.351495Z digest=sha256:10c06d7e7e716ecc792c3c75a9e5dc90f9fe6336a492c2afd68d53591101a4b4

Observation ce8b6928-7725-4f9a-ad72-f4fcab158215 · outbound

This paper cites LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT.

A Non-autoregressive Model for Joint STT and TTS LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.356241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.356241Z digest=sha256:3384fda1f9c914226fff726204c8b9c9bab0cbf4706380152e821a22f37e68aa

Observation e745e0e5-a8ee-4a6a-bcf3-0b8162d14bab · outbound

This paper cites SeamlessM4T: Massively Multilingual & Multimodal Machine Translation.

A Non-autoregressive Model for Joint STT and TTS SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.361491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.361491Z digest=sha256:06b5008d50adadae7b1a1e4d39240bc317820a37386ab1dc3bed6426a3dd9271

Observation 986c61e3-f5ce-4887-9e99-81673de043b5 · outbound

This paper cites SpeechVerse: A Large-scale Generalizable Audio Language Model.

A Non-autoregressive Model for Joint STT and TTS SpeechVerse: A Large-scale Generalizable Audio Language Model

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.366374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.366374Z digest=sha256:5aa4afa4191a32f0bc79b0146cacd1b670dfa1d9c810d2d1d1488a82a43030c4

Observation 5070c066-6467-47c6-9d22-90b4fb84ef2b · outbound

This paper cites Viola: Conditional language models for speech recognition, synthesis, and translation,.

A Non-autoregressive Model for Joint STT and TTS Viola: Conditional language models for speech recognition, synthesis, and translation,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.127478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.371562Z digest=sha256:a887c0d4bd84262f30b64c7a19f5754177fecdfe0a145d621645ea4ce1c5aedc

Observation 210853eb-d742-4853-9626-2bc877e506f7 · outbound

This paper cites FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs.

A Non-autoregressive Model for Joint STT and TTS FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.376868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.376868Z digest=sha256:fcc87367f732b2668309da591bab77a713ebeb8054dc4db41fc3887b7e0a9dbd

Observation e92e1ccd-e614-476f-b7f5-bd0aca3b7af6 · outbound

This paper cites OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification.

A Non-autoregressive Model for Joint STT and TTS OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.381704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.381704Z digest=sha256:5fc91695b2236bec58860a87627e00f2866e65c37fad558b47dd28d62332640d

Observation e185ac2e-fefd-4400-94fb-57479b7a0087 · outbound

This paper cites Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,.

A Non-autoregressive Model for Joint STT and TTS Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.387144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.387144Z digest=sha256:aae91daa843b6b513bd332db2652d4dd49a80119f42bf991be8fb486ef07e552

Observation 9d7e56b1-3251-4f64-8795-59b5b151f0e1 · outbound

This paper cites Fastspeech: Fast, robust and controllable text to speech,.

A Non-autoregressive Model for Joint STT and TTS Fastspeech: Fast, robust and controllable text to speech,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.391635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.391635Z digest=sha256:16c81faaef0f81e3adcd13a755d55e442ab673fc5501c237f981447b92507809

Observation 9135e5b5-2be5-4f6a-9626-61a1d0b3309e · outbound

This paper cites Joist: A joint speech and text streaming model for asr,.

A Non-autoregressive Model for Joint STT and TTS Joist: A joint speech and text streaming model for asr,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.090188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.396298Z digest=sha256:ecf8f9cf22e33137379bd1db76b6e11e23595d59de73d762c5af53650e3abf7b

Observation f8c5f476-a811-4f5a-a647-fdfd02816f7a · outbound

This paper cites Integrating text inputs for training and adapting rnn transducer asr models,.

A Non-autoregressive Model for Joint STT and TTS Integrating text inputs for training and adapting rnn transducer asr models,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.074509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.401786Z digest=sha256:452c6c0ab90fe60884555e9fcb062959018d1bc00107b88579438eccf49df22c

Observation 3c595c02-b884-4bc0-8e2e-5249f72347bb · outbound

This paper cites Semi-autoregressive streaming asr with label context,.

A Non-autoregressive Model for Joint STT and TTS Semi-autoregressive streaming asr with label context,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.057689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.406510Z digest=sha256:085c0f46ba3a3a655004e52dcc20317c55f893b60f96dad4e3ea558b725a1479

Observation c82be303-93f6-488a-b8f6-e55b71a57ae6 · outbound

This paper cites Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment.

A Non-autoregressive Model for Joint STT and TTS Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:15:28.760841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.411135Z digest=sha256:c0ef7afbb516bfb2144316755a0bf98a79492867d90a2674987ef4d51981a481

Observation 6d57ffeb-8354-48c8-b6a0-a6e84ac19d02 · outbound

This paper cites Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict.

A Non-autoregressive Model for Joint STT and TTS Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:15:28.738910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.416162Z digest=sha256:9a0ccecfe455b8e68be4e3a85ac58cf5de26d4a081e075f7838090c161bd34a0

Observation a5baa8fd-78f8-46dc-bc2c-7badce02f133 · outbound

This paper cites BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model.

A Non-autoregressive Model for Joint STT and TTS BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-10T20:15:28.715509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.421118Z digest=sha256:ead00fa1fc62662a0b5fa1577899dfc572a3197a634c55d784b06d7a15428a39

Observation 2e82dfc9-12b7-4d54-9ae0-f774b1688393 · outbound

This paper cites Bectra: Transducer-based end-to-end asr with bert-enhanced encoder,.

A Non-autoregressive Model for Joint STT and TTS Bectra: Transducer-based end-to-end asr with bert-enhanced encoder,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.040118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.426110Z digest=sha256:4012dbb48a015cc0a589588b4c2a4ec8847e1b48d01e43ee5cc3df8ff1dd8284

Observation 52ffb3d8-360b-4cb8-bd8d-dddbaa6cada6 · outbound

This paper cites Mask-conformer: Augmenting conformer with mask-predict decoder,.

A Non-autoregressive Model for Joint STT and TTS Mask-conformer: Augmenting conformer with mask-predict decoder,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:29.022217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.430810Z digest=sha256:8ee30211b9d6028b10bf3135193f3f54d0a25fadb0af0b33e00f6e6017add65c

Observation 5e40e57e-16cc-46c1-93a4-c962b429327d · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations,.

A Non-autoregressive Model for Joint STT and TTS wav2vec 2.0: A framework for self-supervised learning of speech representations,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.435399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.435399Z digest=sha256:cb3aabc8171f760b937b8b7cb9f52b3560d430d24e50a490fb4dde4c0272a2c9

Observation afc07b86-e777-44ab-b611-e14c315d9f89 · outbound

This paper cites Layer normalization,.

A Non-autoregressive Model for Joint STT and TTS Layer normalization,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.440501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.440501Z digest=sha256:2b2de3a30284e5b565f1724b9a92966578aeffa0f903196ca72bb30ba5aea92d

Observation 7279e4c5-b81f-4fdb-b014-702de35ec5c3 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

A Non-autoregressive Model for Joint STT and TTS UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.445462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.445462Z digest=sha256:8e5caf4301856cd8c30ca33c8dc7ccf5bca9ac7dc59cb4afb20f5071d080d8e2

Observation 3d529b1a-5af5-4d0c-a21c-e91333cc6ae9 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

A Non-autoregressive Model for Joint STT and TTS Robust speech recognition via large-scale weak supervision,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.450541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.450541Z digest=sha256:eea33b703e8090f34a47e2ed4b20c64937fdc2487ac13bf6a36af53dde1a5f4c

Observation 82b3c130-1de6-46c1-aa51-3fb9b5a1f987 · outbound

This paper cites ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models.

A Non-autoregressive Model for Joint STT and TTS ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.455695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.455695Z digest=sha256:20389461aa419ad3887f3f8ea362f9abe22f0eed6b29e320634841cfb08e8dbd

Observation 96cce75b-7029-453f-9f93-4549ae9cf4fe · outbound

This paper cites The lj speech dataset,.

A Non-autoregressive Model for Joint STT and TTS The lj speech dataset,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:28.967736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.460414Z digest=sha256:79db5f43f9bed37ed994f97791644a729ef7f5a4947a6bafca6d00a8b5b1661a

Observation 348305b0-a045-4aff-8f80-e15c448bc940 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

A Non-autoregressive Model for Joint STT and TTS LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.464814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.464814Z digest=sha256:add33c0c23ea4a06e7e51eead79cc42d9075dee521fd1705b7ff9a6aaa76b216

Observation 442bc79f-1de7-4d20-913a-e655ee78199b · outbound

This paper cites Librispeech: an asr corpus based on public domain audio books,.

A Non-autoregressive Model for Joint STT and TTS Librispeech: an asr corpus based on public domain audio books,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.469522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.469522Z digest=sha256:7751a80a6347915fc7151efba9c7949c97d03af55e72ec2d02e0a9f123adb1c4

Observation 7a0bd6be-8bba-440d-92d7-eeb78616a12b · outbound

This paper cites LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus.

A Non-autoregressive Model for Joint STT and TTS LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.474447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.474447Z digest=sha256:d7c56e6bf9d30351140fb510d9bde2d85712dcb2a114de2f1177152d55c16aa1

Observation dba533ba-213b-44b6-b407-465ed4750d52 · outbound

This paper cites Conformer: Convolution-augmented Transformer for Speech Recognition.

A Non-autoregressive Model for Joint STT and TTS Conformer: Convolution-augmented Transformer for Speech Recognition

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.480440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.480440Z digest=sha256:24fe6a4ead66b48dd68a79dd1753db71d8dd3f1ebad779373981aa987b2fc3d8

Observation 18d15006-6a65-46be-87ac-9ce3b30c07ba · outbound

This paper cites ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification.

A Non-autoregressive Model for Joint STT and TTS ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.485951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.485951Z digest=sha256:f6c7755790b4657f272486edd4869af3ba718ab448157f72c264a87c2292778d

Observation 60d7cb1f-ff83-4449-a370-e8cf45f47c44 · outbound

This paper cites Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,.

A Non-autoregressive Model for Joint STT and TTS Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.491768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.491768Z digest=sha256:d6e8ffbea3c54bec3ecb1199a8ab52ef6f4503534e73bad10f893d18fec0a908

Observation 7701a5c4-ff0c-4c81-bba2-b716a10662c7 · outbound

This paper cites SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition.

A Non-autoregressive Model for Joint STT and TTS SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.496296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.496296Z digest=sha256:271e15e5dda2e24236c496fc28c2b03c0a9df0442a6d4d8f14c48373c37e7847

Observation 580a110f-fe7f-4fd9-9ad7-f31e81b52e7c · outbound

This paper cites Audio augmentation for speech recognition.

A Non-autoregressive Model for Joint STT and TTS Audio augmentation for speech recognition

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.500917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.500917Z digest=sha256:0105cd338f810ac3cd76e8b9dbf8cdc639b97bab4fce9515addb53ae7039e0c3

Observation a30e41ff-9fd7-4bbd-a147-5d29be044c01 · outbound

This paper cites Super-convergence: Very fast training of neural networks using large learning rates,.

A Non-autoregressive Model for Joint STT and TTS Super-convergence: Very fast training of neural networks using large learning rates,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.506312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.506312Z digest=sha256:0810c4f8811777c5abc4c443c98587c647bfab85859246ede9673bd38d630a34

Observation d0fdf2ab-b8e7-4cb6-b0e6-66a6fa579f6f · outbound

This paper cites Rethinking the inception architecture for computer vision,.

A Non-autoregressive Model for Joint STT and TTS Rethinking the inception architecture for computer vision,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.510887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.510887Z digest=sha256:245d9bca7a55e75bc52eb28541aedd94a9967fa9261b50d60d1f2e3ee706ac99

Observation f4c980a6-9f46-484e-95ff-654787756f49 · outbound

This paper cites Regularization of neural networks using dropconnect,.

A Non-autoregressive Model for Joint STT and TTS Regularization of neural networks using dropconnect,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:28.891532Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.516216Z digest=sha256:e96f7e473478ebc9eafcb8f032bd54a803dd97520449863bb092382aee3ca0bd

Observation 004df12f-cf94-43a1-b93f-989747bbc029 · outbound

This paper cites Sequence noise injected training for end-to-end speech recognition,.

A Non-autoregressive Model for Joint STT and TTS Sequence noise injected training for end-to-end speech recognition,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T20:15:28.873661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T20:15:28.520889Z digest=sha256:a285cb7d12c896ce8909a1af275e5dee1f7bd8f4c35d272b0d60aa033729fa81

Observation 9a06238f-8bab-4481-971b-91cb02c8bc78 · outbound

This paper cites Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions.

A Non-autoregressive Model for Joint STT and TTS Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.525732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.525732Z digest=sha256:e91cc8ad141a51e10bef3c3584ae6ab35fd1f9018af69ad1a8dc47ff5b171c97

Observation 25f1d255-6d72-4087-87ff-f4a4ff22e5fa · outbound

This paper cites FastSpeech 2: Fast and High-Quality End-to-End Text to Speech.

A Non-autoregressive Model for Joint STT and TTS FastSpeech 2: Fast and High-Quality End-to-End Text to Speech

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T20:15:28.530654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:15:28.530654Z digest=sha256:2e6ceb6b3bbd0a91190b336276e0f2b61822d0f57386dc575d163f4cbcb1e4c2

Pith citing papers

No inbound Pith citation observations are available.