Pith. sign in

Paper Citation Record · LEDGER

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages

As of 15 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2501.00425.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.00425 v1

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T22:54:41.302863Z

measured 29 of 29 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:43:47.005650Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-10T18:43:47.187288Z

Reference resolution

28 of 28 outbound references displayed

  • verified exact3
  • verified fuzzy15
  • unresolved9
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e6da0fc7-e8bc-4218-b044-0f42865e781b · outbound

This paper cites Dialect-specific models for automatic speech recognition of african american vernacular english.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Dialect-specific models for automatic speech recognition of african american vernacular english

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.996947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.172677Z digest=sha256:683e56a8167d01f59cb5c1fbfb5f22d3bf7221247a5aa547882873a4f3709611

Observation da3a0dc6-e8d9-4b03-87cc-c95c3f89a564 · outbound

This paper cites Data augmentation based unsupervised pre-training for low-resource speech recognition.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Data augmentation based unsupervised pre-training for low-resource speech recognition

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.949685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.188028Z digest=sha256:eeebf705b607a366ff1efc1b462ac00e9d9c22507101ce859e6954cc7a8be9d8

Observation 9e267dd8-9ecf-40e4-baf8-1b753f01691a · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages wav2vec 2.0: A framework for self-supervised learning of speech representations

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.918606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.207483Z digest=sha256:1804eb9c47cab52277bdf175974c174eadc9e184caff50f50ad39ec12b241029

Observation 0dceeb26-7b48-4090-bb1d-4a9ba842f279 · outbound

This paper cites Applying wav2vec2 for Speech Recognition on Bengali Common Voices Dataset.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Applying wav2vec2 for Speech Recognition on Bengali Common Voices Dataset

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-08-10T22:54:41.497010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.217141Z digest=sha256:322716c2e2a35023555790724462d4a256297b8fb225f7ee98a776e5a9d3a101

Observation e259409a-53b1-4a27-b493-d5185e89d97c · outbound

This paper cites Hubert: How much can a bad teacher benefit asr pre-training? In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6533–6537.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Hubert: How much can a bad teacher benefit asr pre-training? In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6533–6537

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.888231Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.227978Z digest=sha256:7d3715a03878273549512d9eba351a35a8e1d5c9f27bda17b3e0c5022fc9695e

Observation da638638-8257-41e3-b364-a3b80a2ae026 · outbound

This paper cites Unsupervised methods for speaker diarization: An integrated and iterative approach.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Unsupervised methods for speaker diarization: An integrated and iterative approach

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.872830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.243149Z digest=sha256:6107d1d61fd65fd722b9a9c1dbd168c1f46c222435cb3e81e91e857a7eb202ab

Observation b7a0e015-f6c5-403d-80d9-05a17b610c3c · outbound

This paper cites Speaker-dependent live quranic verses recitation recognition system using sphinx-4 framework.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Speaker-dependent live quranic verses recitation recognition system using sphinx-4 framework

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.841401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.252438Z digest=sha256:f894c9bfaf1490600455ccf9e59923e499a190942323f9ebbe1e7f2fdd8c7dbe

Observation 479b46e5-f504-44f3-ba89-b3db4e829920 · outbound

This paper cites A Speech Representation Anonymization Framework via Selective Noise Perturbation.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages A Speech Representation Anonymization Framework via Selective Noise Perturbation

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-10T22:54:41.412413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.262582Z digest=sha256:88fca077f58ecf898a85f9d441d620a588aee1261b3827ed9ea18d3c75e0080e

Observation 6edc091d-4c06-4325-aef1-c506d177465e · outbound

This paper cites FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.267748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.267748Z digest=sha256:63e7ac74e1c10267a1ed723c387b939bc2928e29dd921cb698f61f6b3b255545

Observation aa485003-a78d-4b0c-920b-5c604ec2c12c · outbound

This paper cites Common Voice: A Massively-Multilingual Speech Corpus.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Common Voice: A Massively-Multilingual Speech Corpus

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.272845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.272845Z digest=sha256:5b388f4919167ba4199284335ac773de643bfc77a4932c4af5a4bdc897292504

Observation c8f52638-b88b-4942-aef7-228e37c6be5d · outbound

This paper cites V oice-based gender recognition using neural network.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages V oice-based gender recognition using neural network

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.825162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.277736Z digest=sha256:4f22d065bff45f8e925e1123416b32aa98665762ce90780f768114cd04f71b4e

Observation 4ca325f8-e22b-48e6-90fb-f7be6d614807 · outbound

This paper cites Data augmentation for low resource languages.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Data augmentation for low resource languages

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.809860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.282481Z digest=sha256:540397b23d355ced025529bb15f2c829c3db22a66f4caac698448c4f5b40e95e

Observation a5a9f3e9-e2ba-4b10-916f-c481d48e896f · outbound

This paper cites Synthetic data augmen- tation for improving low-resource asr.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Synthetic data augmen- tation for improving low-resource asr

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.792948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.287267Z digest=sha256:0083c4819e1db7dd4a4510f6e20152a3bed682fb824b9965c17de0851b56e060

Observation 092ce753-2ff7-464e-a030-4266d7621472 · outbound

This paper cites Gaussian Error Linear Units (GELUs).

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Gaussian Error Linear Units (GELUs)

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.292201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.292201Z digest=sha256:04fb2c82db6209dacb19da50e4f342f3cc195a5d866f33373166c61b94ad016c

Observation 23e9ac2a-142f-41db-98fd-9067014b6e72 · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.297251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.297251Z digest=sha256:ca8720fbb0a801d223bfe78eb54a8d7888f8e5bdba0b2cbf2341d0b74d1ebd23

Observation af88de90-3386-4198-a08c-fe8fa0a474ae · outbound

This paper cites Investigating transformer encoders and fusion strategies for speech emotion recognition in emergency call center conversations.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Investigating transformer encoders and fusion strategies for speech emotion recognition in emergency call center conversations

Reference 1996

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.903308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.212333Z digest=sha256:c3c3a0fc20f68f3b1b2cbe80cfa08f4de5799bc738784911d6e3d4620003effd

Observation 41cd191d-f9de-4772-9b23-d5e60dd34773 · outbound

This paper cites Towards fast and accurate streaming end-to-end asr.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Towards fast and accurate streaming end-to-end asr

Reference 2004

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.857834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.247695Z digest=sha256:3af3dec34785cc6492f19da59aad5ce21b0283ed7720f429dabcaaeb5cd47b85

Observation d0f42430-e63a-496f-b811-6f3078c51e7f · outbound

This paper cites O’Shea, Johnathan Corgan, and T.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages O’Shea, Johnathan Corgan, and T

Reference 2013

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.934083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.197892Z digest=sha256:4cc7a901a8edf239835a807dec3c7b6ecc875f8b35c654ae502b31ac27703cd2

Observation bf1d231d-dcab-4b57-b14a-24a7fd16adaf · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Robust Speech Recognition via Large-Scale Weak Supervision

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.257036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.257036Z digest=sha256:4abd1505137719a1e05369878c3d9530ebbe0fdef815e1fd6bcf1578fe398642

Observation a7f13f8e-7509-4889-9594-fcd79b1314d4 · outbound

This paper cites Thanh Toan Nguyen, Minh Tam Pham, Thanh Tam Nguyen, Thanh Trung Huynh, Quoc Viet Hung Nguyen, Thanh Tho Quan, et al.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Thanh Toan Nguyen, Minh Tam Pham, Thanh Tam Nguyen, Thanh Trung Huynh, Quoc Viet Hung Nguyen, Thanh Tho Quan, et al

Reference 2016

Resolution
metadata mismatch
raw_fallback, observed 2026-08-10T22:54:41.668470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.202716Z digest=sha256:fc226c7c14f02b6cbc52b8642c704f903f13ecf3450cd6536fa43d2edf41be84

Observation c868e4b6-5734-4006-b441-ff640ce658b8 · outbound

This paper cites LSTM based Similarity Measurement with Spectral Clustering for Speaker Diarization.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages LSTM based Similarity Measurement with Spectral Clustering for Speaker Diarization

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.238006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.238006Z digest=sha256:f7d8e2f96b4f9b38772c39390c384747c6f26f93a1c78843423060080ad91c1e

Observation 255a2ce8-e53d-4df1-8d51-9d4c57604619 · outbound

This paper cites Hierarchical conditional end-to-end asr with ctc and multi-granular subword units.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Hierarchical conditional end-to-end asr with ctc and multi-granular subword units

Reference 2018

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.776524Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.302863Z digest=sha256:18cbe2dfa41b9e184f28f5c21d5c4cd6bd91e0d2d91bbedb2171b6132ab0ddd2

Observation c050a680-2230-437f-b03d-425adc99b5b7 · outbound

This paper cites Improving noise robust automatic speech recognition with single-channel time-domain enhancement network.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Improving noise robust automatic speech recognition with single-channel time-domain enhancement network

Reference 2019

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.982017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.178011Z digest=sha256:620c8e6d72e313eeeafce400bd172b5d627b861b49f0ed41d57d0507d0422953

Observation ce315c9e-2fbe-4d65-9705-4b2695bd66c1 · outbound

This paper cites Personalizing ASR for Dysarthric and Accented Speech with Limited Data.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Personalizing ASR for Dysarthric and Accented Speech with Limited Data

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.222445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.222445Z digest=sha256:1abd967f2fc9c1feefb28f22bd5bf696e790fe3cfaf8da1c8b0be44b6e0f2a8b

Observation acbce505-8bb2-4d4f-84aa-6c3ac0063834 · outbound

This paper cites Dialectal arabic speech recognition using cnn-lstm based on end-to-end deep learning.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Dialectal arabic speech recognition using cnn-lstm based on end-to-end deep learning

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T22:54:41.966339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.183044Z digest=sha256:37bf56d8e68e9dac2fdd4668b65e6e15aafc60456261d0c37dd529f6b2a60ea7

Observation eea46360-1f09-465e-9608-da6315fdbc4a · outbound

This paper cites ClovaCall: Korean Goal-Oriented Dialog Speech Corpus for Automatic Speech Recognition of Contact Centers.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages ClovaCall: Korean Goal-Oriented Dialog Speech Corpus for Automatic Speech Recognition of Contact Centers

Reference 2022

Resolution
verified exact
local_arxiv, observed 2026-08-10T22:54:41.760599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T22:54:41.166992Z digest=sha256:d777244f82112957991fb170a6e253bb0ec4a81053d5dd98e5740d4107eb0c90

Observation 7e291949-b18f-4edc-83c0-4ea31f0071e1 · outbound

This paper cites A Thousand Words are Worth More Than One Recording: NLP Based Speaker Change Point Detection.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages A Thousand Words are Worth More Than One Recording: NLP Based Speaker Change Point Detection

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.232814Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.232814Z digest=sha256:087dff991b8cf59cb48917e83c93c72edcc969422e938062477a25757b03b40d

Observation ccc970f0-1489-4b0a-b5ec-3855f670cc3f · outbound

This paper cites Anuroop Sriram, Michael Auli, and Alexei Baevski.

Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages Anuroop Sriram, Michael Auli, and Alexei Baevski

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-10T22:54:41.192707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:54:41.192707Z digest=sha256:140b902f53e0bfbb51792fb66b0205283934bac492cc05a76e10becd45ee9c42

Pith citing papers

Observation 89e8cd90-4c2f-47dd-bd95-02add609d68e · inbound

Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets cites this paper.

Enhancing Neural Spoken Language Recognition: An Exploration with Multilingual Datasets Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-08-10T18:43:47.190924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-10T18:43:47.005650Z digest=sha256:9a97c0dd1469ad54f2ce4538fb1f76527183aecaf4756606a24a69cdc894c40a