Pith. sign in

Paper Citation Record · LEDGER

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition

As of 17 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2505.22251.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.22251 v2

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:18:01.686274Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T22:51:15.098039Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-28T22:52:44.973580Z

Reference resolution

39 of 39 outbound references displayed

  • verified exact0
  • verified fuzzy24
  • unresolved15
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e51946b5-eedc-4742-9706-00bb3ea0841f · outbound

This paper cites Prompting large language models with speech recognition abilities,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Prompting large language models with speech recognition abilities,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:06.007622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:57.672482Z digest=sha256:5dabba772e4d06c07fe62ba5bac224d187314fab7755382603395439afb86c28

Observation 82ca8082-c047-4b76-aa76-599ae9d6f911 · outbound

This paper cites Salsa: Speedy asr-llm synchronous aggregation,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Salsa: Speedy asr-llm synchronous aggregation,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:05.832740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:57.773788Z digest=sha256:415221578c3af4697bd5178b8690187103f25b24639633475e7e61073f362177

Observation e5c9e119-9eac-45d8-a44e-e4032f22e4fb · outbound

This paper cites Delayed fusion: Integrating large language models into first- pass decoding in end-to-end speech recognition,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Delayed fusion: Integrating large language models into first- pass decoding in end-to-end speech recognition,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:05.655581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:57.878148Z digest=sha256:2a34f0b32bcf20d51730417c99ec77d269874e1e94c8319deb4f2a0c26fdee00

Observation a97d9d19-e543-44ee-8123-a8ea3890fc73 · outbound

This paper cites Let's Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCR.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Let's Fuse Step by Step: A Generative Fusion Decoding Algorithm with LLMs for Robust and Instruction-Aware ASR and OCR

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:57.992010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:57.992010Z digest=sha256:b3ba21018422735c968a8235ed780867e513b701b8a21e295c7af68c0b9ad36b

Observation 30f794d4-eb9c-47e0-a134-779f495bdd9f · outbound

This paper cites COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:58.104459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:58.104459Z digest=sha256:e221b3e924a62fbea9d2302ddc493468d2fc15d86ba9736127701ae6303f8ea8

Observation 1848cb06-81ef-41d0-ae81-f904473fe067 · outbound

This paper cites On decoder-only architec- ture for speech-to-text and large language model integration,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition On decoder-only architec- ture for speech-to-text and large language model integration,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:05.481616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:58.185843Z digest=sha256:119de777fa8d5383c6a950d03873fa9227eb5a9ac6cd1b5097da127ca0dfd0b9

Observation f2334377-8217-4782-9570-370dd76bed53 · outbound

This paper cites Can Generative Large Language Models Perform ASR Error Correction?.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Can Generative Large Language Models Perform ASR Error Correction?

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:58.378986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:58.378986Z digest=sha256:80b3b5bc0d6c1e53cf5d79db4eda55439674716e0bb71d8173780e511b7e9f32

Observation 579a16f0-cc67-44db-8fc6-063faad13915 · outbound

This paper cites Contextual spelling correction with large language models,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Contextual spelling correction with large language models,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:05.269833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:58.491470Z digest=sha256:8c08d8501ff913966252bb751be2ad464e3bea248c7b78a592999029bd05b8c8

Observation bd9d0c1a-9bd8-4a7b-af49-08c078b1c8bc · outbound

This paper cites Denoising LM: Pushing the limits of error correction models for speech recognition,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Denoising LM: Pushing the limits of error correction models for speech recognition,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:58.590808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:58.590808Z digest=sha256:4d85921df3edce699bcc365fc6c8e48edb5f78324e57a8db35796d5c156c8ed9

Observation 20558f48-2ba2-4662-9ace-e767da79a8bc · outbound

This paper cites NLP evaluation in trouble: On the need to measure LLM data contamination for each benchmark,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition NLP evaluation in trouble: On the need to measure LLM data contamination for each benchmark,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:05.065536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:58.719183Z digest=sha256:97cc2f780a7fe14356002bdfd9ed29fe8f1c342a95b8125723705c4bff1725e7

Observation a5fbcd1b-5a4b-473f-92be-3d3fc27230e3 · outbound

This paper cites Data contamination: From mem- orization to exploitation,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Data contamination: From mem- orization to exploitation,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:04.910943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:58.845669Z digest=sha256:ef89ce83c9bf33d58f08b123e5566285d7331e2766f344f47e0d4cb69dcb3d77

Observation d0f92251-4b5d-4cd0-9784-3197c3cb07ae · outbound

This paper cites Leak, cheat, repeat: Data contamination and evaluation malpractices in closed-source LLMs,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Leak, cheat, repeat: Data contamination and evaluation malpractices in closed-source LLMs,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:04.742613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:58.921580Z digest=sha256:f699b4320f8361f8b33b50bcfa31f1b500065c29b3edd7d53b0de64bed7b7eba

Observation 2cb5b22d-a54c-4581-8366-baa3bdd85dfa · outbound

This paper cites Lib- rispeech: An ASR corpus based on public domain audio books,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Lib- rispeech: An ASR corpus based on public domain audio books,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:04.572516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:59.019387Z digest=sha256:9f0046d9193fb9ca74e55fa7a4371df53d4ed4b1f6662a9ec1a5bdd6f50ca604

Observation e27156b0-dd5c-40d6-ac32-2675cfb83de5 · outbound

This paper cites Common voice: A massively-multilingual speech corpus,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Common voice: A massively-multilingual speech corpus,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:04.448183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:59.145288Z digest=sha256:c848cc95025c1e0a6f409a6f08185acdab3ef7cafec992b3ce287f0c2c5e2c34

Observation 66807b87-4d71-456c-b571-8ab88bb88c99 · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:59.257220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:59.257220Z digest=sha256:f693eacb61c3d374c4a9f821fa9e3d6a3961b5f806f1ddd873b35d57469d2271

Observation ae18e7e6-64e0-4c1d-bd23-23fa1a04c57a · outbound

This paper cites Comparing discrete and continuous space llms for speech recognition,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Comparing discrete and continuous space llms for speech recognition,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:04.342946Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:59.330018Z digest=sha256:8482eff263ea9934d883c8539ee91f6a3d8091c7801e03f51da7b44f4ee7936b

Observation 47c931db-4bf3-46f6-aa78-2b90cefacb9d · outbound

This paper cites Connecting speech encoder and large language model for ASR,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Connecting speech encoder and large language model for ASR,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:04.063947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:59.495385Z digest=sha256:bb4e28d59412d8e87edb9fa7948610619dee05e300c160528f38b147a91f9608

Observation d87d8bc6-a3bb-4405-8617-b3fdbe805c69 · outbound

This paper cites An Embarrassingly Simple Approach for LLM with Strong ASR Capacity.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition An Embarrassingly Simple Approach for LLM with Strong ASR Capacity

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:59.596297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:59.596297Z digest=sha256:ef8cbe37091402887f8d3a9682f83ce83806b0e0560fd9fa6e308c79ce5b92bd

Observation 0901f8d5-522a-4fc3-9a6d-41b30ebce6f4 · outbound

This paper cites WavLLM: Towards Robust and Adaptive Speech Large Language Model.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition WavLLM: Towards Robust and Adaptive Speech Large Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:59.761074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:59.761074Z digest=sha256:fceca1f692516e43ccf4bb3f32050d38bd72d5e44e556e929b901521af4d059e

Observation a7b04456-488c-47da-9c15-3d516c30a64f · outbound

This paper cites Efficient Streaming LLM for Speech Recognition.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Efficient Streaming LLM for Speech Recognition

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:17:59.819028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:17:59.819028Z digest=sha256:c69f64be1b2baacfed2f68cf82de1fce1c43b8cf6bbb9db640bfdacddcbeca03

Observation 0dc9d712-d060-4667-a2c6-104c24596087 · outbound

This paper cites Ctc-assisted llm-based contextual asr,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Ctc-assisted llm-based contextual asr,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.950181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:59.878246Z digest=sha256:e9bc03b51df62eb8b028f0d97eec5430b962dd3c96c721d3f7928e378889323b

Observation 93838fd6-cedd-4eff-9577-2989b3746f90 · outbound

This paper cites The bigscience ROOTS corpus: A 1.6TB composite multilingual dataset,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition The bigscience ROOTS corpus: A 1.6TB composite multilingual dataset,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.828371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:17:59.974379Z digest=sha256:c33f42669b446bdc7f08d08ecfd5e00ab7b45d2b6d4d497e45135f6d8de42dc8

Observation 813bbacb-f1be-4c2e-a6b9-3ceb4ffffae6 · outbound

This paper cites RedPajama: an open dataset for training large language models,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition RedPajama: an open dataset for training large language models,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.691614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:00.145791Z digest=sha256:de813d3faf79426b19c36c7f3b02ad8e588ea1ff25132a785b5bdb84b9eab7be

Observation 9508cdb2-5227-4d14-89d6-c753b08e84fa · outbound

This paper cites Dolma: an open corpus of three trillion tokens for language model pretraining research,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Dolma: an open corpus of three trillion tokens for language model pretraining research,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.572575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:00.241349Z digest=sha256:47de52e6fa1d1109ea3d9f0dd8101da2420060098da500000267a0b95d5ea3ae

Observation bca93d8b-50e0-40af-ae8a-631cc3c33fcc · outbound

This paper cites LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:00.321479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:00.321479Z digest=sha256:4ae1718ba29da23861bc6220561e5d05c28f778e819a64b5dbf37bb355ce6b8c

Observation dac2a22a-6122-4127-b0af-09d970d02d07 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:00.418973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:00.418973Z digest=sha256:743c833619a65ece1cce64c3947980ad0497b0567c92e0cebfb0a55fe729511c

Observation fe0a6792-3ef8-4a52-bd2e-d1347e81dd8e · outbound

This paper cites The Llama 3 Herd of Models.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition The Llama 3 Herd of Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:00.496111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:00.496111Z digest=sha256:b6e266ddf0be15209f19a6f4f2b1d09f7f486977ca3520009e355f280392b64a

Observation ae8ac505-2c60-4ce1-a392-e459fc14b16d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition LLaMA: Open and Efficient Foundation Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:00.592114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:00.592114Z digest=sha256:0d65a899fbdb53fb6b280951dee2d45a3fb35f7c8a7cc2892e2fa11f71041915

Observation d1012a3e-8e98-4224-8bb6-a5961c78016d · outbound

This paper cites Leskovec, A.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Leskovec, A

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.390008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:00.715018Z digest=sha256:d94d2c3715831b11b5eb1d6e10522f9b84fa982bc79a9033ed13ba3bac4c58e0

Observation 963276c5-1b92-4756-ae75-7220c0c22c4b · outbound

This paper cites Benchmarking non- parametric statistical tests,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Benchmarking non- parametric statistical tests,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.213721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:00.810541Z digest=sha256:c541b21fac60367599cc79aa0611c70523f0d5538b165d0b8a87c4c3c059fd32

Observation 3e11ba02-3e84-4659-b8b7-06f2db9663c4 · outbound

This paper cites Confidence intervals for evaluation in machine learning.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Confidence intervals for evaluation in machine learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:00.895479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:00.895479Z digest=sha256:7a0c96f892b7a0e48bced64d3461d1ade8ebb7a43ae7c20caddff70761873326

Observation 2ca12751-7f35-42c3-9e4d-f0963c7c566a · outbound

This paper cites Pythia: A suite for analyzing large language models across training and scaling,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Pythia: A suite for analyzing large language models across training and scaling,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:03.032271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:01.017697Z digest=sha256:217d5970a51f4f4c3e50090a25ed55cf2bc0e0feafd3d7d211bd6d544fd00988

Observation 987ac905-bc74-4c2f-9c94-179b75bebcc4 · outbound

This paper cites GPT-NeoX-20B: An open-source autoregressive language model,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition GPT-NeoX-20B: An open-source autoregressive language model,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:02.840529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:01.144965Z digest=sha256:1a30eb0adb223821d159da14559ddfce93ed51f8308b022704e53bc973255ba3

Observation 72c03d69-2317-4751-a8c3-9cb4bce3e637 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition OPT: Open Pre-trained Transformer Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:01.230964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:01.230964Z digest=sha256:3e1e9bf233b5a22bfd3c9840899e4229aa75a99794753daca3477291793c4340

Observation f7103772-83af-47fd-a90e-5ef74418b67d · outbound

This paper cites OLMo: Accelerating the science of language models,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition OLMo: Accelerating the science of language models,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:02.677131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:01.319044Z digest=sha256:9fcc54250bf526aff3e410d81a2518b6f0a01eb91613d90bef4b5828d009c501

Observation 532a5e63-10f6-4de3-a0a2-77984b0eeef9 · outbound

This paper cites The secret sharer: Evaluating and testing unintended memorization in neural networks,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition The secret sharer: Evaluating and testing unintended memorization in neural networks,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:02.534516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:01.409238Z digest=sha256:9b99b720cca8a0f3e28131be356d20b26c65750ece115778955d368123f6f25c

Observation 21b8daf0-bacf-4925-9322-a8e58f77506c · outbound

This paper cites Open- source conversational AI with SpeechBrain 1.0,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition Open- source conversational AI with SpeechBrain 1.0,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:02.316139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:01.500777Z digest=sha256:ade59efbbd1bb7ef426bea197727a7a65145a8a0a787ee8bed292de177cefe44

Observation 69c183be-540d-4daf-9b3c-65659e666f3c · outbound

This paper cites WavLM: Large-scale self-supervised pre-training for full stack speech processing,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition WavLM: Large-scale self-supervised pre-training for full stack speech processing,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T13:18:01.593951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:18:01.593951Z digest=sha256:84e88806b6180474a137e45232873ca332248f6591083dd37990ca8a155bac67

Observation 50495929-d525-42b5-8230-3f8f68f3cb4a · outbound

This paper cites SpecAugment: A simple data augmen- tation method for automatic speech recognition,.

Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition SpecAugment: A simple data augmen- tation method for automatic speech recognition,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:18:02.141680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-07T13:18:01.686274Z digest=sha256:a86b4ed204e4589eb4372cae15e53a16e1f36aa067d90f590d53188ada1bd873

Pith citing papers

Observation 57f39226-af22-4d2e-bf6f-cf48af4400e7 · inbound

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering cites this paper.

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-16T14:07:58.664363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-16T14:04:17.935630Z digest=sha256:e960d8d98dbdbf3ea2c7cea4bc0982b71ad4a690dc7099d6fa09e0b8889ddf96

Observation a74ba727-e03f-42d1-a4b3-ce8ce35bf26d · inbound

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models cites this paper.

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-12T00:41:26.371213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-07T14:29:18.348031Z digest=sha256:a7f405ef2f3c5c40da37cd08ca4d34dade468749229dee08d5320ce59a3b8fa7

Observation 7dcc69a9-dd97-4fa6-aa8c-2094b28938bd · inbound

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER) cites this paper.

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER) Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:52:44.975160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T22:51:15.098039Z digest=sha256:f142735d2b6783d3ec91480e3e342501e0bb37bd54d29abbf5a395594fd451d5