Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-10T12:30:52.147660Z
Paper Citation Record · LEDGER
As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 8 inbound Pith citation observations for arXiv:2501.17202.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-10T12:30:52.147660Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-07T11:28:47.037457Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T19:00:05.360195Z
36 of 36 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 72f6b656-f1c1-4690-901a-b2d9f560d298 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d3b5dfb2-17d1-469e-979f-074636907a6d · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators According to the context, please judge if SpeechA is better or SpeechB is better. Only output ’[SpeechA]’ or ’[SpeechB]’, do not give any analysis
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation d8f58b33-42e1-48d5-8162-21e7b7495b96 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Salm: Speech-augmented lan- guage model with in-context learning for speech recognition and translation
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 56e69171-dae9-441e-9911-22dcb5fc5c79 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Ghostt5: generate more features with cheap operations to improve textless spoken question answering
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 785c26a6-6838-4358-8ea6-728b54a3ca98 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Qwen2-Audio Technical Report
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0d6ae150-c2a3-4019-8461-8dec0dcc0e70 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators How do Voices from Past Speech Synthesis Challenges Compare Today?
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 67fffb3a-0004-466f-bfee-4a17bb9aaebb · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Generalization ability of mos prediction networks
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 7f99a486-1e1d-4278-8654-29993913b120 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Clotho: An audio captioning dataset
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 99e646cd-c4c4-4ed1-b863-3c2239f1ecc6 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Prompting large language models with speech recognition abilities
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation af01fda4-9b9f-4db8-b018-cab064837118 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators LoRA: Low-Rank Adaptation of Large Language Models
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1ec89678-f4b5-4d0e-a619-1e8f71e72fff · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators WavLLM: Towards Robust and Adaptive Speech Large Language Model
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0ef43b0a-9349-4030-b0a8-5cd18c9f655b · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation e338897b-139b-4f6c-89cd-c03b2dc76461 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators MOSNet: Deep Learning based Objective Assessment for Voice Conversion
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation be93759f-f1ab-42ed-97ef-c47e7ef11280 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4bc70127-4c19-4bfa-b837-93d4f26b9626 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Whispering llama: A cross-modal generative error correction frame- work for speech recognition
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 714ba838-3b14-40d6-b964-3367cd81ea53 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators AudioPaLM: A Large Language Model That Can Speak and Listen
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation de610b51-3a87-41b9-8064-5dcb08fbdf24 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Large language model-based emo- tional speech annotation using context and acoustic feature for speech emotion recognition
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 95c70b80-3a3d-4e1a-acd9-5e242e341fc7 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SALMONN: Towards Generic Hearing Abilities for Large Language Models
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 70d887ba-6232-4255-b4e9-aaab41a0aae8 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Extending large language models for speech and audio captioning
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation fe446ed3-36a1-40ec-b0c3-b413ca1f4057 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators LLaMA: Open and Efficient Foundation Language Models
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c2368ce1-04f7-4276-9826-ba0755ec981e · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Towards measuring fairness in speech recognition: Fair-Speech dataset
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b4f0a4d9-b092-4129-845f-35131503a03f · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 6bd2fd62-9bab-4198-8585-37b31aac14d6 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3de16e73-a858-4fdb-a294-805dacb001cb · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18c5dfe3-80e9-4824-9cce-ed51a1483fc7 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4227ac8c-0e9f-43de-b704-ca92fdc2644e · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators The overall MOS is:
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation cbe61ebe-1ea8-4841-a900-d20a5fa16e6f · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators AudioBench: A Universal Benchmark for Audio Large Language Models
Reference 2005
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 906cd69b-d30e-43f9-9143-7bb3626278ef · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SpeechVerse: A Large-scale Generalizable Audio Language Model
Reference 2007
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 28145f5d-254e-40d4-8700-a60560f4bed6 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
Reference 2015
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d78d5ae2-659d-4f9f-ac33-a6669d093d25 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators mSLAM: Massively multilingual joint pre-training for speech and text
Reference 2016
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 52791c61-0c25-417a-a2f8-6e053af36743 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators SOMOS: The Samsung Open MOS Dataset for the Evaluation of Neural Text-to-Speech Synthesis
Reference 2019
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 44e780f9-a587-49a4-b6f5-4539d3c92ace · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators An Actor-Critic Algorithm for Sequence Prediction
Reference 2020
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 86eb0baa-8cc8-41de-b3b5-487722b3924c · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5d190569-ab3c-40ea-b88f-2df489d5d019 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Language models are few-shot learners
Reference 2022
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e23cb481-5b37-4662-9441-e97edffc5004 · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Neural mos prediction for synthesized speech using multi-task learning with spoofing detection and spoofing type classification
Reference 2023
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation a820f333-86f3-46f8-b3e8-c2ec82ea625a · outbound
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators Common Voice: A Massively-Multilingual Speech Corpus
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ffd1783b-d96b-45b3-875b-cd32e9e3f7cc · inbound
Breaking the Barriers of Text-Hungry and Audio-Deficient AI Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4438c967-708a-4a77-b424-5c1fea0523df · inbound
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 96ac5bb8-720a-4bd5-9a60-a338f7edbafb · inbound
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2f15453f-4e66-438b-9c6a-b6ef15e87eff · inbound
Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 87afe5aa-34f3-4a35-8bf4-c560a04f6c03 · inbound
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation 7c8cc6cd-a618-4569-aef5-029501514883 · inbound
Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation cde5ebd0-4423-4e58-9e2a-a4b0db38dcef · inbound
ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.
Observation f011e11f-c333-499d-8a32-f0ac6a4bab85 · inbound
X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
Reference 145
Source-reported events for the cited work
Unavailable: canonical work link unavailable.