Pith. sign in

Paper Citation Record · LEDGER

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 8 inbound Pith citation observations for arXiv:2501.17202.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.17202 v2

Coverage vector

measured 36 of 36 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T12:30:52.147660Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:28:47.037457Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T19:00:05.360195Z

Reference resolution

36 of 36 outbound references displayed

  • verified exact2
  • verified fuzzy11
  • unresolved22
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 72f6b656-f1c1-4690-901a-b2d9f560d298 · outbound

This paper cites SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:51.999801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:51.999801Z digest=sha256:80d963cca87c70f58486c260a7407adc22af5294c0bca99b8ad498c1ecfa3319

Observation d3b5dfb2-17d1-469e-979f-074636907a6d · outbound

This paper cites According to the context, please judge if SpeechA is better or SpeechB is better. Only output ’[SpeechA]’ or ’[SpeechB]’, do not give any analysis.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators According to the context, please judge if SpeechA is better or SpeechB is better. Only output ’[SpeechA]’ or ’[SpeechB]’, do not give any analysis

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.478830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.147660Z digest=sha256:ff950cdfdd35213876385503a92526db2726ac603c66e4545c5c5c537e343b31

Observation d8f58b33-42e1-48d5-8162-21e7b7495b96 · outbound

This paper cites Salm: Speech-augmented lan- guage model with in-context learning for speech recognition and translation.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Salm: Speech-augmented lan- guage model with in-context learning for speech recognition and translation

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.602001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.026529Z digest=sha256:193b7fc4b56b29f68ed811911591bd1517b50ce51cb7050d8bb4a1fc1f6d166a

Observation 56e69171-dae9-441e-9911-22dcb5fc5c79 · outbound

This paper cites Ghostt5: generate more features with cheap operations to improve textless spoken question answering.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Ghostt5: generate more features with cheap operations to improve textless spoken question answering

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.588957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.030802Z digest=sha256:3e4c92a62531666d77671b0fcd8f38bb83f9e249a6901a937ef40f263ec49dae

Observation 785c26a6-6838-4358-8ea6-728b54a3ca98 · outbound

This paper cites Qwen2-Audio Technical Report.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Qwen2-Audio Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.043996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.043996Z digest=sha256:332097f233d769d97120de762c05b25d143542dada16722c69fe2d61ffa37c1e

Observation 0d6ae150-c2a3-4019-8461-8dec0dcc0e70 · outbound

This paper cites How do Voices from Past Speech Synthesis Challenges Compare Today?.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators How do Voices from Past Speech Synthesis Challenges Compare Today?

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-08-10T12:30:52.398187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.048466Z digest=sha256:f3ec7b8addc9cebfd04921e72c063b7fdf797086de67d6ed178a7d656ffb0a09

Observation 67fffb3a-0004-466f-bfee-4a17bb9aaebb · outbound

This paper cites Generalization ability of mos prediction networks.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Generalization ability of mos prediction networks

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.564190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.053077Z digest=sha256:ecd10ab60220e84bfdb4682d66bbfb6dadf3fe2d05ccc7f44d7c1af721765e06

Observation 7f99a486-1e1d-4278-8654-29993913b120 · outbound

This paper cites Clotho: An audio captioning dataset.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Clotho: An audio captioning dataset

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.552390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.061931Z digest=sha256:357da45b284d9323eb66e8dd15deca2a0a26fdf07872ce1b2a612cbf252b5a6e

Observation 99e646cd-c4c4-4ed1-b863-3c2239f1ecc6 · outbound

This paper cites Prompting large language models with speech recognition abilities.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Prompting large language models with speech recognition abilities

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.540069Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.065596Z digest=sha256:bbac661803055f4750313df728446a01539039ae1515097177ee4cd1f6066b74

Observation af01fda4-9b9f-4db8-b018-cab064837118 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators LoRA: Low-Rank Adaptation of Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.069262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.069262Z digest=sha256:52c398256649ff6c2e8e8485d674c6dd6d46f1f93d98bcf076ff5c9acb1f42e3

Observation 1ec89678-f4b5-4d0e-a619-1e8f71e72fff · outbound

This paper cites WavLLM: Towards Robust and Adaptive Speech Large Language Model.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators WavLLM: Towards Robust and Adaptive Speech Large Language Model

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.072980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.072980Z digest=sha256:d29adb16e857f6570c46781bf85a158eca15141bade7b23ca6edab2f0b02b4ee

Observation 0ef43b0a-9349-4030-b0a8-5cd18c9f655b · outbound

This paper cites WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding

Reference 18

Resolution
metadata mismatch
local_arxiv, observed 2026-08-10T12:30:52.348858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.076824Z digest=sha256:e0cb2247d30c15652675a08cff1cbe8a53e0d751c4d9a31f3438ece91a061931

Observation e338897b-139b-4f6c-89cd-c03b2dc76461 · outbound

This paper cites MOSNet: Deep Learning based Objective Assessment for Voice Conversion.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators MOSNet: Deep Learning based Objective Assessment for Voice Conversion

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.080500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.080500Z digest=sha256:517876eaefe0db64d13ef292534c8ef00ad2dc260d075109c8ca76a32048c6aa

Observation be93759f-f1ab-42ed-97ef-c47e7ef11280 · outbound

This paper cites NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.089145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.089145Z digest=sha256:e38ae5b5e96ddd8557f6cb9c51786969ea4f15cb24547b20589d3c9b5ad6c163

Observation 4bc70127-4c19-4bfa-b837-93d4f26b9626 · outbound

This paper cites Whispering llama: A cross-modal generative error correction frame- work for speech recognition.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Whispering llama: A cross-modal generative error correction frame- work for speech recognition

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.526693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.096847Z digest=sha256:f2d256566014cf577117ea08d49f989298e7fa789d673ff51e23684302f6d6db

Observation 714ba838-3b14-40d6-b964-3367cd81ea53 · outbound

This paper cites AudioPaLM: A Large Language Model That Can Speak and Listen.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.099804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.099804Z digest=sha256:c2799c0ba21284b21fbd80f71fcc61fb1cbf1a79b43cc87d9022205faf00c673

Observation de610b51-3a87-41b9-8064-5dcb08fbdf24 · outbound

This paper cites Large language model-based emo- tional speech annotation using context and acoustic feature for speech emotion recognition.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Large language model-based emo- tional speech annotation using context and acoustic feature for speech emotion recognition

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.514233Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.103494Z digest=sha256:0965a43bb657e9dc8537eaf40dc698a380287c703dbd771e92aac99e7ca3dda0

Observation 95c70b80-3a3d-4e1a-acd9-5e242e341fc7 · outbound

This paper cites SALMONN: Towards Generic Hearing Abilities for Large Language Models.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SALMONN: Towards Generic Hearing Abilities for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.106870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.106870Z digest=sha256:385c8cf1137c18ca40d145462034c439c219ac5dc4cf668dd3fa4ccf55fa19c0

Observation 70d887ba-6232-4255-b4e9-aaab41a0aae8 · outbound

This paper cites Extending large language models for speech and audio captioning.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Extending large language models for speech and audio captioning

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.501554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.110807Z digest=sha256:af3f002249e79ccf27f86e41ad214a8cd64c6b1eb1a4610ccc5ab06bca275563

Observation fe446ed3-36a1-40ec-b0c3-b413ca1f4057 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators LLaMA: Open and Efficient Foundation Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.114839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.114839Z digest=sha256:b1e8f070a06ac9444dd8adfdd043a4f23ffae17f91d2affc5a71bcd8d21f1034

Observation c2368ce1-04f7-4276-9826-ba0755ec981e · outbound

This paper cites Towards measuring fairness in speech recognition: Fair-Speech dataset.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Towards measuring fairness in speech recognition: Fair-Speech dataset

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.119226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.119226Z digest=sha256:62ec2434e8ad06639f3cf0bf6b24943799898fe7d5d0b5b92326584ec5c3aec2

Observation b4f0a4d9-b092-4129-845f-35131503a03f · outbound

This paper cites Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-08-10T12:30:52.228037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.127254Z digest=sha256:de8a3e02fe283a317f824042d5c479ddc11fea54a9252ebcd67cc6bf185bacc3

Observation 6bd2fd62-9bab-4198-8585-37b31aac14d6 · outbound

This paper cites AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.131510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.131510Z digest=sha256:76ccad442643544846553ae6c1460972bf6baeb57a96d826959a88dcc43d9cfe

Observation 3de16e73-a858-4fdb-a294-805dacb001cb · outbound

This paper cites SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.135405Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.135405Z digest=sha256:44eceea637b5879295a017f7e0e9823ee81559a2cc5217d9d120b5ae4ca7e26b

Observation 18c5dfe3-80e9-4824-9cce-ed51a1483fc7 · outbound

This paper cites Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.139252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.139252Z digest=sha256:23c6686f58a4bc6bb0a4327df4c49ea3309ccbb688d190fc5d0a78e6f05422bc

Observation 4227ac8c-0e9f-43de-b704-ca92fdc2644e · outbound

This paper cites The overall MOS is:.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators The overall MOS is:

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.490160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.143267Z digest=sha256:c7bcd21a0b54415418d7bdd7ebeb9b421f3d83324a766f3afe7cfb0bafb9b1a8

Observation cbe61ebe-1ea8-4841-a900-d20a5fa16e6f · outbound

This paper cites AudioBench: A Universal Benchmark for Audio Large Language Models.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators AudioBench: A Universal Benchmark for Audio Large Language Models

Reference 2005

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.122984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.122984Z digest=sha256:d3410ea0f76b736d021e4c19fb0f3285a04afa56cae9fb7be551a394ede00bd2

Observation 906cd69b-d30e-43f9-9143-7bb3626278ef · outbound

This paper cites SpeechVerse: A Large-scale Generalizable Audio Language Model.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SpeechVerse: A Large-scale Generalizable Audio Language Model

Reference 2007

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.057019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.057019Z digest=sha256:7d5f5e36b113877bfa9d951edaac221408db009dcf582afe4c0be5a8b09112ae

Observation 28145f5d-254e-40d4-8700-a60560f4bed6 · outbound

This paper cites VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.092877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.092877Z digest=sha256:7733844434a45ca4ae51debe31a8f9ac29c10390b1e126d36af4157dbe418b62

Observation d78d5ae2-659d-4f9f-ac33-a6669d093d25 · outbound

This paper cites mSLAM: Massively multilingual joint pre-training for speech and text.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators mSLAM: Massively multilingual joint pre-training for speech and text

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.016897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.016897Z digest=sha256:cea5add7eb27807145dd96b0a958504de6be8e1ffd5599000ace4190c36d1c47

Observation 52791c61-0c25-417a-a2f8-6e053af36743 · outbound

This paper cites SOMOS: The Samsung Open MOS Dataset for the Evaluation of Neural Text-to-Speech Synthesis.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SOMOS: The Samsung Open MOS Dataset for the Evaluation of Neural Text-to-Speech Synthesis

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.084767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.084767Z digest=sha256:4830e6bcb571a818d24714baa787ff853a902a5d9e7db5b9a06795522a3152dc

Observation 44e780f9-a587-49a4-b6f5-4539d3c92ace · outbound

This paper cites An Actor-Critic Algorithm for Sequence Prediction.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators An Actor-Critic Algorithm for Sequence Prediction

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.011797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.011797Z digest=sha256:d808c17396e65415c557fedf22b36189bf4f55c11659a7ffafdaef2aff2e8a34

Observation 86eb0baa-8cc8-41de-b3b5-487722b3924c · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.039285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.039285Z digest=sha256:c9c736cc1c00a1f2736ec750e278436134faac85b5077975bd41a4784cfda014

Observation 5d190569-ab3c-40ea-b88f-2df489d5d019 · outbound

This paper cites Language models are few-shot learners.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Language models are few-shot learners

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.021805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.021805Z digest=sha256:c02c50ccd949246c682729c6f3909242d866180212a45b1aac5bb53058140071

Observation e23cb481-5b37-4662-9441-e97edffc5004 · outbound

This paper cites Neural mos prediction for synthesized speech using multi-task learning with spoofing detection and spoofing type classification.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Neural mos prediction for synthesized speech using multi-task learning with spoofing detection and spoofing type classification

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T12:30:52.576421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-10T12:30:52.035105Z digest=sha256:6f1da79c7bd567a02da92578095e7468668ce6a203c8591ae2fb0884da6e67e5

Observation a820f333-86f3-46f8-b3e8-c2ec82ea625a · outbound

This paper cites Common Voice: A Massively-Multilingual Speech Corpus.

Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Common Voice: A Massively-Multilingual Speech Corpus

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-10T12:30:52.006659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T12:30:52.006659Z digest=sha256:473ff63d14a7e10ef4b05d1b702d16dd360c6f197ce888a4e7ff8ef0625d9ab7

Pith citing papers

Observation ffd1783b-d96b-45b3-875b-cd32e9e3f7cc · inbound

Breaking the Barriers of Text-Hungry and Audio-Deficient AI cites this paper.

Breaking the Barriers of Text-Hungry and Audio-Deficient AI Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:28:47.037457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:28:47.037457Z digest=sha256:a9d0061d2f2aa9e1346d376ad74c56b058b6c83a0a2e735d0cfe079eccfd2a20

Observation 4438c967-708a-4a77-b424-5c1fea0523df · inbound

A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations cites this paper.

A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T10:17:45.789315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:17:45.789315Z digest=sha256:16ef487b56227a0e45ce553f5670a7d2abe0cbeaa6c2a314638108182ba971af

Observation 96ac5bb8-720a-4bd5-9a60-a338f7edbafb · inbound

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement cites this paper.

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T18:15:19.109526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:15:19.109526Z digest=sha256:5e5c4969d42e9e30062ebbb81af555518c4e1f21b15201aeac15cf695f27145a

Observation 2f15453f-4e66-438b-9c6a-b6ef15e87eff · inbound

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning cites this paper.

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-10T14:25:30.041088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T14:22:25.660785Z digest=sha256:ee182980dd948915f2c4b8eade9951b94982a02dee2f106bf6a5656e0363242c

Observation 87afe5aa-34f3-4a35-8bf4-c560a04f6c03 · inbound

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions cites this paper.

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:01:08.390150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-08T16:43:33.397158Z digest=sha256:0b05034471c04ac2bd3cbc4f8ab6375b1a88c9d1dd876c9c2e0882e51ac21066

Observation 7c8cc6cd-a618-4569-aef5-029501514883 · inbound

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data cites this paper.

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T14:38:28.985717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T07:00:53.430064Z digest=sha256:de458a3f78d460f5c551ae9ebb5583880780b88747b0bf1c1555e558bd9e20fb

Observation cde5ebd0-4423-4e58-9e2a-a4b0db38dcef · inbound

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge cites this paper.

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-07-04T19:00:05.362056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-25T22:07:10.531784Z digest=sha256:7a107d1c1e8d0af0e40df978e959ee28c86f1b4546eacb1be2bc40b840299f5c

Observation f011e11f-c333-499d-8a32-f0ac6a4bab85 · inbound

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment cites this paper.

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment Audio Large Language Models Can Be Descriptive Speech Quality Evaluators

Reference 145

Resolution
unresolved
no resolver link, observed 2026-08-01T07:12:17.685669Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:12:17.685669Z digest=sha256:8bb2204111293205fbcbb614d80ea570cb93b57ba32de88c4f63a2d9868bd991