Pith. sign in

Paper Citation Record · LEDGER

ALAS: An Automatic Latent Alignment Score for Audio Language Models

As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2505.19937.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19937 v3

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:07:23.830824Z

measured 24 of 24 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

24 of 24 outbound references displayed

  • verified exact1
  • verified fuzzy4
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 117a7724-c508-4d03-8e14-3f0b0bd86268 · outbound

This paper cites GPT-4 Technical Report.

ALAS: An Automatic Latent Alignment Score for Audio Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:21.896626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:21.896626Z digest=sha256:730ccbdf9a2f841c6f4a2fd8a2d344a671b61a032c178a2c427ca0e4eec2beca

Observation 5f76d5ca-c8fc-4a70-b4bf-5d5efddd2488 · outbound

This paper cites D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al.

ALAS: An Automatic Latent Alignment Score for Audio Language Models D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:07:24.781925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:07:22.050159Z digest=sha256:32ae1dece43e5960c0b1043c8ee2f452ba5c3a0883ebcab197a724b3667c003f

Observation da7506df-fcba-433e-8503-7e8253153d93 · outbound

This paper cites Qwen2-Audio Technical Report.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Qwen2-Audio Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.240948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.240948Z digest=sha256:03b604207acfbd5ed06820ea3014a38bfff82fe8ed82622b633ad2cec9a435b7

Observation f34a3591-95b3-4b10-9b4e-d2b3dbe235ee · outbound

This paper cites GLM: General Language Model Pretraining with Autoregressive Blank Infilling.

ALAS: An Automatic Latent Alignment Score for Audio Language Models GLM: General Language Model Pretraining with Autoregressive Blank Infilling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.407437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.407437Z digest=sha256:1d73fe6fc0e4dff3ffc399b56214ae1afdcaef3a28ecefc02e41f0018a6d719c

Observation 4ee1ee6e-52f7-4975-adb3-778e897e1cef · outbound

This paper cites Listen, Think, and Understand.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Listen, Think, and Understand

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.512637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.512637Z digest=sha256:951b4247c4758cd31a4d4cd99cca1b9f1d7585325c38813f6cc1346df500a81c

Observation 838fc321-f817-4d08-ae20-4c03750c6c18 · outbound

This paper cites Less peaky and more accurate ctc forced alignment by label priors.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Less peaky and more accurate ctc forced alignment by label priors

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:07:24.668628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:07:22.654319Z digest=sha256:5971c7f8f0b534664002251fc989a78607ecce0ebadb485b1348212f15f33169

Observation 0b8de5be-e226-4aab-a95d-1bee71a71793 · outbound

This paper cites MIMIC-IT: Multi-Modal In-Context Instruction Tuning.

ALAS: An Automatic Latent Alignment Score for Audio Language Models MIMIC-IT: Multi-Modal In-Context Instruction Tuning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.834050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.834050Z digest=sha256:a9344f5afafacb4a8bafbc42b54107cb9732624e4b0b0956d1a824148a5d3895

Observation 40d0e662-d768-4050-b547-09b89b29de55 · outbound

This paper cites Montreal forced aligner: Trainable text- speech alignment using kaldi.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Montreal forced aligner: Trainable text- speech alignment using kaldi

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:07:24.565292Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:07:22.886727Z digest=sha256:1c9ea799d223635cf5354a55b820f1625ef82d6e91f9f91917f54f34a7879fbc

Observation ea1ca65f-c90e-4d56-ba24-7e9ba8b2ebd9 · outbound

This paper cites The 5 ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs kaldi speech recognition toolkit.

ALAS: An Automatic Latent Alignment Score for Audio Language Models The 5 ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs kaldi speech recognition toolkit

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:07:24.448199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:07:23.016716Z digest=sha256:f53187cc6bbdb690502f4e0b8c262cb7d7094079e4e41fe4569a225ba45e9716

Observation 022b5e44-29a8-4f66-be7d-462e045deee4 · outbound

This paper cites SSR: Alignment-Aware Modality Connector for Speech Language Models.

ALAS: An Automatic Latent Alignment Score for Audio Language Models SSR: Alignment-Aware Modality Connector for Speech Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.282165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.282165Z digest=sha256:830a90e4e3574e0b37fe5dd2e1dab8466c3a22ddb55e14b6b0fb93648a95549d

Observation e4c78260-337a-4ee4-8ff8-73621a02d77b · outbound

This paper cites SALMONN: Towards Generic Hearing Abilities for Large Language Models.

ALAS: An Automatic Latent Alignment Score for Audio Language Models SALMONN: Towards Generic Hearing Abilities for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.341592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.341592Z digest=sha256:3da20ca6aad2293cbb62c4c6e380dd7917520100cce57d8326537352515ec44c

Observation 2ad01c76-6895-4f58-90ea-6e42eb139049 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

ALAS: An Automatic Latent Alignment Score for Audio Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.446712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.446712Z digest=sha256:28bb33f0efc55595aa4ae4e018b9cfffad262f67d3ecc22aacbfc404661127d4

Observation 20831a34-18e7-4c68-9a0e-3efe59b7320f · outbound

This paper cites AudioBench: A Universal Benchmark for Audio Large Language Models.

ALAS: An Automatic Latent Alignment Score for Audio Language Models AudioBench: A Universal Benchmark for Audio Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.503947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.503947Z digest=sha256:822e04e980594b617c42c4a34bad894fb7b19f3d2c5d130f2a3a2f56b5687b42

Observation 507516f7-2aaf-42b5-9c23-527be28a2e5d · outbound

This paper cites Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.623745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.623745Z digest=sha256:707efe472ea8be08268ac96f4f9a3fab8b403e44a22f4a5f6d75bc8404d06cd8

Observation 272009db-ab9b-447d-a45b-7dacbfc765b0 · outbound

This paper cites AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling.

ALAS: An Automatic Latent Alignment Score for Audio Language Models AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.738043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.738043Z digest=sha256:f3276ef168a7bd4bbcb24bb888940c447e01760716ebaa9c3fb7b05531e2a121

Observation 905bd063-3264-4878-a381-fae90558398e · outbound

This paper cites Video-LLaMA: An instruction-tuned audio-visual language model for video understanding.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Video-LLaMA: An instruction-tuned audio-visual language model for video understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.830824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.830824Z digest=sha256:610ea7c12550f70f06ca99659709406cef330447dec8807ab3192b489a9aeb59

Observation c481c263-ae91-4edd-b67e-aece03537254 · outbound

This paper cites WavLLM: Towards Robust and Adaptive Speech Large Language Model.

ALAS: An Automatic Latent Alignment Score for Audio Language Models WavLLM: Towards Robust and Adaptive Speech Large Language Model

Reference 2006

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.593442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.593442Z digest=sha256:12ae64348c374db94baea2e35772fa7a45ada738ad2bf7f1557e68ab0e13f36e

Observation 01e6943c-7841-4421-ba24-c3679471688e · outbound

This paper cites X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages.

ALAS: An Automatic Latent Alignment Score for Audio Language Models X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages

Reference 2008

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.142203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.142203Z digest=sha256:950e876d6bfd899a6d65021bafd54dff2acbfbcd885825a9e029e176143af280

Observation 4275cce0-b4bc-449c-ab99-cf883ff0d518 · outbound

This paper cites LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs.

ALAS: An Automatic Latent Alignment Score for Audio Language Models LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs

Reference 2017

Resolution
verified exact
local_arxiv, observed 2026-08-07T14:07:24.190776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T14:07:22.953311Z digest=sha256:4484bbbfd1bc5f274baa1bcb03572326ce7281d22cd96a153553742beadbd369

Observation 171b07cc-0e63-4c17-adaa-75eadafd4fd2 · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.188014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.188014Z digest=sha256:038a065c1ec2d2d4c8c74f8d57430adbea51a55f64d74fd334a2a4c3a04b5db9

Observation 797a0878-61ed-43b0-9bde-1b475a03866f · outbound

This paper cites Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.739092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.739092Z digest=sha256:b75f1aa17bc6738645b75f52b5816f973b3992402fb64b70f6279d0ec0fd442c

Observation 653a531d-516d-43c4-a81d-4a0d21144b4e · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Robust Speech Recognition via Large-Scale Weak Supervision

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:23.097224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:23.097224Z digest=sha256:83fb11677ac3c942940b5cd22424e75cc29bbd4fa8c865ee75b760ca0322c6e9

Observation 4c46a8f5-927f-4f61-8981-28f0fa111913 · outbound

This paper cites Seamless: Multilingual Expressive and Streaming Speech Translation.

ALAS: An Automatic Latent Alignment Score for Audio Language Models Seamless: Multilingual Expressive and Streaming Speech Translation

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:21.971099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:21.971099Z digest=sha256:0a77879d58f2f9e81193605e16a18184744d6dc4da032dacdfd85eece8b29fdd

Observation 09b101c0-a0f2-4d13-ba31-d07cf36a437f · outbound

This paper cites InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning.

ALAS: An Automatic Latent Alignment Score for Audio Language Models InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T14:07:22.328026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:07:22.328026Z digest=sha256:f96d4122be038b60277f6b8e6a571407f457845bdfa6cf924291c02b39e7caa0

Pith citing papers

No inbound Pith citation observations are available.