Pith. sign in

Paper Citation Record · LEDGER

OpusLM: A Family of Open Unified Speech Language Models

As of 19 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2506.17611.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.17611 v1

Coverage vector

measured 57 of 57 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:35:37.514349Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:35:35.805367Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T10:19:47.988040Z

Reference resolution

57 of 57 outbound references displayed

  • verified exact1
  • verified fuzzy30
  • unresolved25
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3b8c5a0a-2ad1-4961-b14a-b848c46c297e · outbound

This paper cites This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6].

OpusLM: A Family of Open Unified Speech Language Models This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6]

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:43.204876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:35.768809Z digest=sha256:8158f2cd7f5fc0dcf2ad97fb892f30b396fa95bc8a7d47e29abc00ea8abec9bf

Observation 9f94f05f-bee1-4862-8945-76bf43178963 · outbound

This paper cites OpusLM: A Family of Open Unified Speech Language Models.

OpusLM: A Family of Open Unified Speech Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 2

Resolution
malformed identifier
no resolver link, observed 2026-08-06T23:35:35.805367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.805367Z digest=sha256:e499509c199fd87fc23b38627ff5ef64ed42c0f41b1458c7d836954750fdab3b

Observation 2111fd18-8b77-4f2a-bc85-96c22520c478 · outbound

This paper cites Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22].

OpusLM: A Family of Open Unified Speech Language Models Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22]

Reference 3

Resolution
verified exact
raw_fallback, observed 2026-08-06T23:35:39.596126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:35.845196Z digest=sha256:150a76ed771a7383219437ce53518e628c4163429f2207d688d0102263ec2f02

Observation 0c65bce9-1a68-4cfd-9bf3-0ba1d36a8361 · outbound

This paper cites The code, data, checkpoints, and training logs are released to support open speech language model research in the community.

OpusLM: A Family of Open Unified Speech Language Models The code, data, checkpoints, and training logs are released to support open speech language model research in the community

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:43.044755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:35.891220Z digest=sha256:0ebe0b19002362854ec468cc7a8425ded16dbf5d176606128a326980de289ca7

Observation 5673b951-608c-4260-8a48-770788453204 · outbound

This paper cites 18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch.

OpusLM: A Family of Open Unified Speech Language Models 18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.894750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:35.928366Z digest=sha256:ae17279b037952f8d6acb91a756674bab68a7a40a2ecb33c15bc9d2f9bece5f1

Observation 3ff11d81-8665-4a31-9c7a-1f0999cb9d6d · outbound

This paper cites GPT-4 Technical Report.

OpusLM: A Family of Open Unified Speech Language Models GPT-4 Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.964871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.964871Z digest=sha256:6d7ead64b2023b18ce05409ac525ff21dffe40440879ac098ce9509ba2310b5f

Observation da065035-e9bc-4f03-8750-778e2e82fe75 · outbound

This paper cites The Llama 3 Herd of Models.

OpusLM: A Family of Open Unified Speech Language Models The Llama 3 Herd of Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.991787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.991787Z digest=sha256:103f9acb57cce9dd24be122a70cdc4f75b91ca1412fcb3ba6e027d7702806a0d

Observation ff696368-a817-4e6b-9932-d2321378b2c5 · outbound

This paper cites A Survey of Large Language Models.

OpusLM: A Family of Open Unified Speech Language Models A Survey of Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.998119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.998119Z digest=sha256:e3df0178f034b76c582d8e0515db1106ebb3a2c693cee150f1249bf695efa4ed

Observation bb72e72e-eb31-46a0-8cd5-6748b6f876b0 · outbound

This paper cites Recent Advances in Speech Language Models: A Survey.

OpusLM: A Family of Open Unified Speech Language Models Recent Advances in Speech Language Models: A Survey

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.004978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.004978Z digest=sha256:5ac62e864ffe9634f1d0726116e99dcc2588f90d215d3cf6b071e002c7a2d1de

Observation 73bd60e5-4c44-43e7-b345-b972a9be184a · outbound

This paper cites A survey on speech large language models,.

OpusLM: A Family of Open Unified Speech Language Models A survey on speech large language models,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.046876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.046876Z digest=sha256:83bed200d51aac59a3cc20922ed410a52ad0a673c001e1f87bae8f7d91ba4789

Observation b65c5f37-2a5f-4cad-b67c-2cbb5e689769 · outbound

This paper cites WavChat: A Survey of Spoken Dialogue Models.

OpusLM: A Family of Open Unified Speech Language Models WavChat: A Survey of Spoken Dialogue Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.084747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.084747Z digest=sha256:06d0542b6b4735f84155851d9cf1b5863dee308ea42e7e4b4f47108df30cc057

Observation 8ef6a9b0-5cb3-4c18-af6d-6e8ef37cb0ea · outbound

This paper cites Qwen2-Audio Technical Report.

OpusLM: A Family of Open Unified Speech Language Models Qwen2-Audio Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.144749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.144749Z digest=sha256:2e45a84f2dfe374fd934c4841bc95b7bb28d15fa8d7f1b2c730d20e35b65428d

Observation 1116a37e-1c1a-4135-8dc9-802542cac382 · outbound

This paper cites V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,.

OpusLM: A Family of Open Unified Speech Language Models V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.712790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.184826Z digest=sha256:0bc6202f9b1f0732d6effaf5c41998a21165360877566507edc2d6951d5f898e

Observation bb2df365-0857-4293-8b3a-fe758f918271 · outbound

This paper cites Uniaudio: Towards universal audio generation with large language models,.

OpusLM: A Family of Open Unified Speech Language Models Uniaudio: Towards universal audio generation with large language models,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.598157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.226145Z digest=sha256:3077f593e39b7a8390d622aa8f2e1b63036fc9deb60a70d5aede91f13de98c8a

Observation 91e9715e-1895-40cf-980a-feaa593d1713 · outbound

This paper cites SpeechX: Neural codec language model as a ver- satile speech transformer,.

OpusLM: A Family of Open Unified Speech Language Models SpeechX: Neural codec language model as a ver- satile speech transformer,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.497580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.284828Z digest=sha256:fffc9b4d0d76147bf7bf038f04c7bb13da421af02ffa85d8ed587ddad4efc292

Observation e58d9ddf-40d0-4d10-893d-ff661ecaf7eb · outbound

This paper cites Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling.

OpusLM: A Family of Open Unified Speech Language Models Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.334752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.334752Z digest=sha256:ab81e2eb1dd28fc77ccf1b45b4c0a4b6cd87f690c889bfb26b025b3445df10ea

Observation 8be3e27d-70a3-4345-aa55-5203dfe1087e · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

OpusLM: A Family of Open Unified Speech Language Models Moshi: a speech-text foundation model for real-time dialogue

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.384751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.384751Z digest=sha256:4ea2b4a59a7650596f9456325ee8b1388db795269af0343d94da0a2299ac97e1

Observation 4671bcde-ba59-4488-adc5-c0b8b2c4d638 · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

OpusLM: A Family of Open Unified Speech Language Models VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.434750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.434750Z digest=sha256:327922d173d62893d3c87dc9ef6640f076086761a684a776cd5f928e757aacce

Observation 6c5dedfc-9ad4-4aea-a19b-e1f21db0a1b9 · outbound

This paper cites Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities.

OpusLM: A Family of Open Unified Speech Language Models Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.459737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.459737Z digest=sha256:109435ff8f58c07e960daab4ec1a72cd64ddb655ee0737b138ce810038f896d8

Observation 4ea713a3-5306-4c83-8481-dcaf28e86912 · outbound

This paper cites GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,.

OpusLM: A Family of Open Unified Speech Language Models GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.447416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.484883Z digest=sha256:d8578cc3ac641914b5d9b51a0c6dac29f75d72fa8bb10519d1e66f4f98c8e4e1

Observation c52f4991-75aa-4ad9-bc57-22d18667c366 · outbound

This paper cites Ocean-omni: To understand the world with omni- modality,.

OpusLM: A Family of Open Unified Speech Language Models Ocean-omni: To understand the world with omni- modality,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.524956Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.524956Z digest=sha256:0e76342091af089a3ec2befbb5211d37e154e6bfc9251a6bf8bdd343e8bd4e78

Observation a8d48137-7d0c-489f-86b0-9e6e0c7883a8 · outbound

This paper cites V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,.

OpusLM: A Family of Open Unified Speech Language Models V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.325354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.551512Z digest=sha256:b588b5012e2aebf4be13903c442a46079e3d93677ab8ff57c4bfbce572d5f34b

Observation 1302e537-cbc1-4284-b308-3a2af68d494c · outbound

This paper cites Role of intelligence tests in speech/language,.

OpusLM: A Family of Open Unified Speech Language Models Role of intelligence tests in speech/language,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.026476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.568157Z digest=sha256:dc14470849ad154a8d731f0bf4bb6699565649068e1a81008ccaa27c3dc38980

Observation 8f3ab886-beea-43fa-973c-b2a58273f08a · outbound

This paper cites GPT-4o System Card.

OpusLM: A Family of Open Unified Speech Language Models GPT-4o System Card

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.580526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.580526Z digest=sha256:aa8efd4a032251e082faa30c12d2cbfba6a2a89499f99d2993a8fab52a46505b

Observation 4f1d3656-06bc-49ae-8278-a3baecccb410 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

OpusLM: A Family of Open Unified Speech Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.595070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.595070Z digest=sha256:8e4d3c0c88a74e4c058dff6c3c660782629418ea544d97dd7e179e3f72e000e4

Observation 26861933-ce1a-4d5e-9135-504cbd478843 · outbound

This paper cites Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,.

OpusLM: A Family of Open Unified Speech Language Models Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.664808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.640226Z digest=sha256:ce4701986740bd275c5b0623c48a9cb57706613d292d845ee2fd3a72eb2dadbd

Observation fde3f299-ccb8-4ab8-b995-f13370bbca2c · outbound

This paper cites On the effects of heterogeneous data sources on speech-to-text foundation models,.

OpusLM: A Family of Open Unified Speech Language Models On the effects of heterogeneous data sources on speech-to-text foundation models,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.531325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.659701Z digest=sha256:712a55e619f9b497118c02df0df5de3006fc83f460bc4762c1ef8a04b58d42b1

Observation 7d548fb4-ed25-440b-a023-a30419e2dd8a · outbound

This paper cites 2 OLMo 2 Furious.

OpusLM: A Family of Open Unified Speech Language Models 2 OLMo 2 Furious

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.704077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.704077Z digest=sha256:8bb97fc7d01ae3ba7080bc428a0d713a7e8a0aa6266891b072282e7d196115b4

Observation cc165af1-575a-49b4-8216-c7e6b40122ee · outbound

This paper cites Parler-tts,.

OpusLM: A Family of Open Unified Speech Language Models Parler-tts,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.394807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.735394Z digest=sha256:e6f39f3c97d78a0b71d2ceb8c03494f0530114ba2cfa6fba06c474f0198cb00d

Observation 09dcac45-0ef7-426b-a577-a7b8666813e9 · outbound

This paper cites ESPnet-SpeechLM: An open speech language model toolkit,.

OpusLM: A Family of Open Unified Speech Language Models ESPnet-SpeechLM: An open speech language model toolkit,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.315783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.766750Z digest=sha256:f24ea1062747ea5a0890473e71fc679a137f0c25c102e134d736b38882a1ec9e

Observation b92efcad-d929-43fa-b14b-628ecd758c33 · outbound

This paper cites Librispeech: an ASR corpus based on public domain audio books,.

OpusLM: A Family of Open Unified Speech Language Models Librispeech: an ASR corpus based on public domain audio books,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.183085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.795731Z digest=sha256:0aac21b051f63392ca5dc3db9a94a2f692b0ce632d2f56c9c300a5f247f06606

Observation 5d1a4c94-3f59-4a24-883d-c38a21e028bd · outbound

This paper cites Measuring Massive Multitask Language Understanding.

OpusLM: A Family of Open Unified Speech Language Models Measuring Massive Multitask Language Understanding

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.816221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.816221Z digest=sha256:b585aea713df881c771d044309b2ef8f5e8253500b76296ef184aa14f82c370b

Observation 5e0c97e7-7dd4-4d1e-add7-3e9cf29eccd5 · outbound

This paper cites SALMONN: Towards generic hearing abilities for large language models,.

OpusLM: A Family of Open Unified Speech Language Models SALMONN: Towards generic hearing abilities for large language models,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.834754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.834754Z digest=sha256:04174555610b44a34db7365bb8edb19e96922dda752c112c0ff7626f7be28a1c

Observation 9c573230-f601-4b7c-ac62-6424680a70b1 · outbound

This paper cites Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,.

OpusLM: A Family of Open Unified Speech Language Models Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.025369Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.880206Z digest=sha256:7e96bdb19c8340c4166ec03424084ce7037fef1dca9af24a6d9d8801809968e1

Observation 1ee27a7c-4577-4596-9748-7656a98eb793 · outbound

This paper cites Audiolm: a language modeling approach to au- dio generation,.

OpusLM: A Family of Open Unified Speech Language Models Audiolm: a language modeling approach to au- dio generation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.926122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.905232Z digest=sha256:2bc1fa062673affc0d01145b777154316124d0ca9a3302a2beac2d962ba54af6

Observation 8b28a046-c13e-47e0-83bb-8465db3a9f11 · outbound

This paper cites Soundstream: An end-to-end neural audio codec,.

OpusLM: A Family of Open Unified Speech Language Models Soundstream: An end-to-end neural audio codec,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.834738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.954999Z digest=sha256:c86ace9b5204a59f060f3dc87ff156db792f804d0eba23373eef89a28c16e981

Observation ec395036-1136-4f94-aa1d-8f93c6921728 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

OpusLM: A Family of Open Unified Speech Language Models Robust speech recognition via large-scale weak supervision,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.709792Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:36.993493Z digest=sha256:e119d4369924c3c530935a6a5f25d0cc35856e77f64ffd3ddef2dc65cf9db808

Observation e48e996f-b2a4-4258-9e71-c0d01fd405a6 · outbound

This paper cites Chattts: A generative speech model for daily dialogue.

OpusLM: A Family of Open Unified Speech Language Models Chattts: A generative speech model for daily dialogue

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.625504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.024923Z digest=sha256:5b70fd307fb9c69057ef4dcd163eeb72d1853e38c9dd669d3a804ed713c605b3

Observation 52c982af-42cf-4abd-b1fe-a57526a91a20 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

OpusLM: A Family of Open Unified Speech Language Models CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.056647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.056647Z digest=sha256:e78990c874229e901be82ea28abc15eabd7abecdb237d773d09672ecd5e2d301

Observation 9e742353-f459-4b9c-ac78-b736f50fc1cf · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

OpusLM: A Family of Open Unified Speech Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.094892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.094892Z digest=sha256:54122ff991a5ce4353efd549b660dc80f5a7b7fe4f3213298694ecff8df7a64d

Observation db665f08-39dd-412a-adc2-67c86da45994 · outbound

This paper cites SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model.

OpusLM: A Family of Open Unified Speech Language Models SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.134608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.134608Z digest=sha256:8074c2d100cd1990e582467279e1b31cf084b7d18122dfa8c24f8cd021919547

Observation 85ea1877-d18b-41a0-930e-5a3f1e7bed1f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

OpusLM: A Family of Open Unified Speech Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.174496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.174496Z digest=sha256:660515ba7f1de785b474c34fc71eb2b5acddeb532de03fea14b3e65de2af1f44

Observation ca0fb67c-5e01-41e9-8158-5e48fa6eec11 · outbound

This paper cites Spirit LM: Interleaved Spoken and Written Language Model.

OpusLM: A Family of Open Unified Speech Language Models Spirit LM: Interleaved Spoken and Written Language Model

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.204906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.204906Z digest=sha256:0be8b48025cf42fa30737df1f71ea762c252b1659082a468c1a4b7bfae3f6717

Observation 187d76d5-0bd2-4fa4-8b85-ed7273abebba · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

OpusLM: A Family of Open Unified Speech Language Models Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.245740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.245740Z digest=sha256:9fe5f5c3ce339d1aa987cfff5961527539a9162e3449f8e68d67c34885fa6e76

Observation 4bac999b-59ee-4a72-a9a4-2d16557f4151 · outbound

This paper cites Simple and controllable music generation,.

OpusLM: A Family of Open Unified Speech Language Models Simple and controllable music generation,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.490526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.300784Z digest=sha256:288ececbdbaeef3d8fc48b2c0d53aad4e1ed7bff9ed8bc0eef52ee1fb9a3356c

Observation 9a757072-8620-42d5-a437-5f474632bdf8 · outbound

This paper cites Yodas: Youtube-oriented dataset for audio and speech,.

OpusLM: A Family of Open Unified Speech Language Models Yodas: Youtube-oriented dataset for audio and speech,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.367605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.372656Z digest=sha256:584c9c09e10dbfc31bcd8f55115370685ef0dea7ca1ef189148866a551b5a6c7

Observation ca97a751-3b71-4ba0-8951-a4cf453e6657 · outbound

This paper cites Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,.

OpusLM: A Family of Open Unified Speech Language Models Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.184279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.405956Z digest=sha256:d4c1d041f6ee22336b92e0b2c801f4284cbdcc62733aafc7658fed5e823c5d5e

Observation 65ddbee9-59c0-436a-aab1-22171199b815 · outbound

This paper cites Zero: Memory optimizations toward train- ing trillion parameter models,.

OpusLM: A Family of Open Unified Speech Language Models Zero: Memory optimizations toward train- ing trillion parameter models,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.045832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.442538Z digest=sha256:b7dee878d9bf7f860675f876b142bbe6daae05c91a8393d0a9dd568d786e986c

Observation d9b3c04b-0266-4fb1-95c4-a650d1126fec · outbound

This paper cites PaLM: Scaling language modeling with pathways,.

OpusLM: A Family of Open Unified Speech Language Models PaLM: Scaling language modeling with pathways,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.974737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.458194Z digest=sha256:07f48f15b30e6fcc9874182f10f2bec3b67c8ef8687da3610f1e697f5baf2958

Observation dd4aadb3-8619-433c-bae1-7017716076b2 · outbound

This paper cites FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,.

OpusLM: A Family of Open Unified Speech Language Models FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.856931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.461483Z digest=sha256:dc038bc424c8fb711f976dd90cb6d5219082a54d536dca2f686faec319080421

Observation 3fc516ab-3b33-4181-8635-6bca30a8bc91 · outbound

This paper cites Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,.

OpusLM: A Family of Open Unified Speech Language Models Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.810512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.465720Z digest=sha256:e391b9c0a8247fc6f86dba2fbf858ff9ce706cf13d1cad1844529ed28a661492

Observation 08caaae5-b12d-4ccb-b00d-ae804b134964 · outbound

This paper cites Utmos: Utokyo-sarulab system for voicemos challenge 2022,.

OpusLM: A Family of Open Unified Speech Language Models Utmos: Utokyo-sarulab system for voicemos challenge 2022,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.766985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.468734Z digest=sha256:ba48665f5644843acc441bfd479b5e4e15d7802d6520512426a1cc37d5d72e2f

Observation 65ee1f7f-35da-48d7-a95e-209464a251ed · outbound

This paper cites VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music.

OpusLM: A Family of Open Unified Speech Language Models VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.473556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.473556Z digest=sha256:d859d9894a432fe2579bea513cdc253dcfde102bb2551af986e5a958e336af5f

Observation a9101987-efe9-471d-ac91-c6d6b31b1f83 · outbound

This paper cites Libritts: A corpus derived from librispeech for text-to-speech,.

OpusLM: A Family of Open Unified Speech Language Models Libritts: A corpus derived from librispeech for text-to-speech,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.496340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.496340Z digest=sha256:07f76b88b5a7be6aaa90390eac39a7e1fe094e538c6bc24ceba7aeeafad4e9f8

Observation daa7046c-f4db-4b86-b692-c43c444eba75 · outbound

This paper cites CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,.

OpusLM: A Family of Open Unified Speech Language Models CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.691760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.500919Z digest=sha256:87042c276f85cd61d7ee45818d124ed700d3f153487f8a068e9867189a4b4298

Observation 7a57c7ba-333d-4465-bc03-0569157b14cd · outbound

This paper cites GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,.

OpusLM: A Family of Open Unified Speech Language Models GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.673426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.509743Z digest=sha256:d4f099297f2605375dc2e1da38b54f3deb10eb33519bddfd9322961c151a9b68

Observation 6c9ed181-5e46-4ca3-851f-922926ed02af · outbound

This paper cites Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,.

OpusLM: A Family of Open Unified Speech Language Models Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.661422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:35:37.514349Z digest=sha256:4fc0c2df47f2ab8e98b863d6fd3ef038ced16d61c1c733a743b94c32c33b1902

Pith citing papers

Observation 9f94f05f-bee1-4862-8945-76bf43178963 · inbound

OpusLM: A Family of Open Unified Speech Language Models cites this paper.

OpusLM: A Family of Open Unified Speech Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 2

Resolution
malformed identifier
no resolver link, observed 2026-08-06T23:35:35.805367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.805367Z digest=sha256:e499509c199fd87fc23b38627ff5ef64ed42c0f41b1458c7d836954750fdab3b

Observation f7ac93b2-b13d-4169-bc04-40c1e4174723 · inbound

UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models cites this paper.

UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T11:29:35.787283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:29:35.787283Z digest=sha256:84df17a41599b14183a42b522de9b9de3bcec8f98abac4d94a24ceec571e4219

Observation 2ac87cda-fac0-4a2f-84c8-27f14ebcf149 · inbound

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis cites this paper.

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis OpusLM: A Family of Open Unified Speech Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-04T10:19:47.989537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-26T08:54:18.325054Z digest=sha256:76eaa19636006c05d63b66abdec5d6ccc5164488844add6e0cbfe1affa423270

Observation 4e7d6f72-051e-4415-8efb-3bb12206aa9f · inbound

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation cites this paper.

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation OpusLM: A Family of Open Unified Speech Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T05:07:38.317151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-07-03T05:04:23.295592Z digest=sha256:107bf3decc94ac69116af6e58a5a8ad70f016f76eb5ccc047decb73fb4d57e4f