Pith. sign in

Paper Citation Record · LEDGER

OpusLM: A Family of Open Unified Speech Language Models

As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2506.17611.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.17611 v1

Coverage vector

measured 57 of 57 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:35:37.514349Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:35:35.805367Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T10:19:47.988040Z

Reference resolution

57 of 57 outbound references displayed

  • verified exact1
  • verified fuzzy30
  • unresolved25
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3b8c5a0a-2ad1-4961-b14a-b848c46c297e · outbound

This paper cites This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6].

OpusLM: A Family of Open Unified Speech Language Models This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6]

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:43.204876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:35.768809Z digest=sha256:2fa1202f4a014dc4cceb0ffc95a0a86f9f3446e9e167fc926467b76c746c6039

Observation 9f94f05f-bee1-4862-8945-76bf43178963 · outbound

This paper cites OpusLM: A Family of Open Unified Speech Language Models.

OpusLM: A Family of Open Unified Speech Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 2

Resolution
malformed identifier
no resolver link, observed 2026-08-06T23:35:35.805367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.805367Z digest=sha256:7552163ee1ac8c4e9472d60ed4aadd7250d0c41b80fc1530155ec5efd6c1c3bf

Observation 2111fd18-8b77-4f2a-bc85-96c22520c478 · outbound

This paper cites Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22].

OpusLM: A Family of Open Unified Speech Language Models Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22]

Reference 3

Resolution
verified exact
raw_fallback, observed 2026-08-06T23:35:39.596126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:35.845196Z digest=sha256:c91f3688bd09e9dbc794d294b460f784fbabf09e3c1f71f3e91a8462cdf1eb43

Observation 0c65bce9-1a68-4cfd-9bf3-0ba1d36a8361 · outbound

This paper cites The code, data, checkpoints, and training logs are released to support open speech language model research in the community.

OpusLM: A Family of Open Unified Speech Language Models The code, data, checkpoints, and training logs are released to support open speech language model research in the community

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:43.044755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:35.891220Z digest=sha256:99804db7aa55b4c2bba5327710774239028e81adae571c124442d3808cc3f2d0

Observation 5673b951-608c-4260-8a48-770788453204 · outbound

This paper cites 18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch.

OpusLM: A Family of Open Unified Speech Language Models 18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.894750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:35.928366Z digest=sha256:0f4696aced1b4888e6f40860b235255edfcc881fd28c67ac65362f919cd31b11

Observation 3ff11d81-8665-4a31-9c7a-1f0999cb9d6d · outbound

This paper cites GPT-4 Technical Report.

OpusLM: A Family of Open Unified Speech Language Models GPT-4 Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.964871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.964871Z digest=sha256:39edc254bef56b5774aab2d17ef8e5ff1f10ec41cf259439975d53a7844d636d

Observation da065035-e9bc-4f03-8750-778e2e82fe75 · outbound

This paper cites The Llama 3 Herd of Models.

OpusLM: A Family of Open Unified Speech Language Models The Llama 3 Herd of Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.991787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.991787Z digest=sha256:7e5615793f13a9419fcbb013196a2f0fc7edf1dbe4194bdeeef1b36b311e6d4b

Observation ff696368-a817-4e6b-9932-d2321378b2c5 · outbound

This paper cites A Survey of Large Language Models.

OpusLM: A Family of Open Unified Speech Language Models A Survey of Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:35.998119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.998119Z digest=sha256:67ac42af58af46fbbc7d843f2f2201d7539244787f9a42c3809276ee6b8932b2

Observation bb72e72e-eb31-46a0-8cd5-6748b6f876b0 · outbound

This paper cites Recent Advances in Speech Language Models: A Survey.

OpusLM: A Family of Open Unified Speech Language Models Recent Advances in Speech Language Models: A Survey

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.004978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.004978Z digest=sha256:c418cb01a6524a7e12de5b94af0fab0850e512f9412bc29876ff01e2424ce52e

Observation 73bd60e5-4c44-43e7-b345-b972a9be184a · outbound

This paper cites A survey on speech large language models,.

OpusLM: A Family of Open Unified Speech Language Models A survey on speech large language models,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.046876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.046876Z digest=sha256:6393fa8fda06de5bb002e9acafee50e747a6b8dd8dd281fd9ae587602a56383b

Observation b65c5f37-2a5f-4cad-b67c-2cbb5e689769 · outbound

This paper cites WavChat: A Survey of Spoken Dialogue Models.

OpusLM: A Family of Open Unified Speech Language Models WavChat: A Survey of Spoken Dialogue Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.084747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.084747Z digest=sha256:f31bcfe2e1b64fbb692b183a6941ad0b7b0479ce64ca3791cde23d19c88008d7

Observation 8ef6a9b0-5cb3-4c18-af6d-6e8ef37cb0ea · outbound

This paper cites Qwen2-Audio Technical Report.

OpusLM: A Family of Open Unified Speech Language Models Qwen2-Audio Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.144749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.144749Z digest=sha256:1ac9c423b9aaf56ec797bf025dc9a55e9db958924382bdaa57ae75b934b68962

Observation 1116a37e-1c1a-4135-8dc9-802542cac382 · outbound

This paper cites V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,.

OpusLM: A Family of Open Unified Speech Language Models V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.712790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.184826Z digest=sha256:efe13b3ae41f9e4651122398034e32708d19bced22144949471e3c999b17b32c

Observation bb2df365-0857-4293-8b3a-fe758f918271 · outbound

This paper cites Uniaudio: Towards universal audio generation with large language models,.

OpusLM: A Family of Open Unified Speech Language Models Uniaudio: Towards universal audio generation with large language models,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.598157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.226145Z digest=sha256:3cb5680fdb51e094f5c9bb13275e9e9f473fc7a7d4243d2d5d06a96aae5c1644

Observation 91e9715e-1895-40cf-980a-feaa593d1713 · outbound

This paper cites SpeechX: Neural codec language model as a ver- satile speech transformer,.

OpusLM: A Family of Open Unified Speech Language Models SpeechX: Neural codec language model as a ver- satile speech transformer,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.497580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.284828Z digest=sha256:9567262e7fb09b1d7afe20a97d510d883da3e7d95ccbbeedb7dc09cce1551f0b

Observation e58d9ddf-40d0-4d10-893d-ff661ecaf7eb · outbound

This paper cites Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling.

OpusLM: A Family of Open Unified Speech Language Models Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.334752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.334752Z digest=sha256:a138781b55105ac93f52d070077edb11198706c65cb05d41207a3c33209ac364

Observation 8be3e27d-70a3-4345-aa55-5203dfe1087e · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

OpusLM: A Family of Open Unified Speech Language Models Moshi: a speech-text foundation model for real-time dialogue

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.384751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.384751Z digest=sha256:75213446bda58fb1802942ee22cfc2e77dae40590bfbf45171aaa157d2bd08a5

Observation 4671bcde-ba59-4488-adc5-c0b8b2c4d638 · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

OpusLM: A Family of Open Unified Speech Language Models VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.434750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.434750Z digest=sha256:6dd7f69db74181c9b17b9b8ecff8d1906fe1e30412635a37ce42b430a49080af

Observation 6c5dedfc-9ad4-4aea-a19b-e1f21db0a1b9 · outbound

This paper cites Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities.

OpusLM: A Family of Open Unified Speech Language Models Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.459737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.459737Z digest=sha256:37b659555db2aa234f80aa165e6791852fca5d58df14723d7186a500e049c57a

Observation 4ea713a3-5306-4c83-8481-dcaf28e86912 · outbound

This paper cites GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,.

OpusLM: A Family of Open Unified Speech Language Models GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.447416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.484883Z digest=sha256:96c84c862dc5fb3d9241d55979305956e6fdbd41fcf512957f81e81ae7a9982b

Observation c52f4991-75aa-4ad9-bc57-22d18667c366 · outbound

This paper cites Ocean-omni: To understand the world with omni- modality,.

OpusLM: A Family of Open Unified Speech Language Models Ocean-omni: To understand the world with omni- modality,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.524956Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.524956Z digest=sha256:b9032cb41521e2ef4c9258e137b6b556eb7063167817fee9b975a06ed6122c7c

Observation a8d48137-7d0c-489f-86b0-9e6e0c7883a8 · outbound

This paper cites V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,.

OpusLM: A Family of Open Unified Speech Language Models V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.325354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.551512Z digest=sha256:e413573daa6321753ce10fbabddaa0958fc87ec1d55bd43cd710ab29953e5c50

Observation 1302e537-cbc1-4284-b308-3a2af68d494c · outbound

This paper cites Role of intelligence tests in speech/language,.

OpusLM: A Family of Open Unified Speech Language Models Role of intelligence tests in speech/language,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:42.026476Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.568157Z digest=sha256:15e1749ccb41561368d9fd761a3f3e55d67abba9461d729cfa0f414406732db3

Observation 8f3ab886-beea-43fa-973c-b2a58273f08a · outbound

This paper cites GPT-4o System Card.

OpusLM: A Family of Open Unified Speech Language Models GPT-4o System Card

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.580526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.580526Z digest=sha256:75d2227997c9f99ce80899cc94d2da62cf58a76b31dbaf871565995d1c00d225

Observation 4f1d3656-06bc-49ae-8278-a3baecccb410 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

OpusLM: A Family of Open Unified Speech Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.595070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.595070Z digest=sha256:4d62963b4a80d50c32368a5fd9fae5c6e1786a0014c2afd7b86a5a27d916e24f

Observation 26861933-ce1a-4d5e-9135-504cbd478843 · outbound

This paper cites Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,.

OpusLM: A Family of Open Unified Speech Language Models Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.664808Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.640226Z digest=sha256:a1c5837396e6a43baaebb6be330e3a1df416948c7249eecfff5949634202199d

Observation fde3f299-ccb8-4ab8-b995-f13370bbca2c · outbound

This paper cites On the effects of heterogeneous data sources on speech-to-text foundation models,.

OpusLM: A Family of Open Unified Speech Language Models On the effects of heterogeneous data sources on speech-to-text foundation models,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.531325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.659701Z digest=sha256:c602fc0ae8c31703da75059f04cf5143f2d3437e89ae7f4f14bc2a189295587d

Observation 7d548fb4-ed25-440b-a023-a30419e2dd8a · outbound

This paper cites 2 OLMo 2 Furious.

OpusLM: A Family of Open Unified Speech Language Models 2 OLMo 2 Furious

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.704077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.704077Z digest=sha256:53efcfb1e2a3738950294f2bb884b80442cc0a16d7ccf740606d58969ed1f039

Observation cc165af1-575a-49b4-8216-c7e6b40122ee · outbound

This paper cites Parler-tts,.

OpusLM: A Family of Open Unified Speech Language Models Parler-tts,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.394807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.735394Z digest=sha256:02bd7390179eb94bdea3a098ce15e11d24fc234b4be862a06d35b4b032a511d7

Observation 09dcac45-0ef7-426b-a577-a7b8666813e9 · outbound

This paper cites ESPnet-SpeechLM: An open speech language model toolkit,.

OpusLM: A Family of Open Unified Speech Language Models ESPnet-SpeechLM: An open speech language model toolkit,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.315783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.766750Z digest=sha256:9be441872531af1a58ac2d979b95d22a59719933bf5e8bafdfd50aead46389a7

Observation b92efcad-d929-43fa-b14b-628ecd758c33 · outbound

This paper cites Librispeech: an ASR corpus based on public domain audio books,.

OpusLM: A Family of Open Unified Speech Language Models Librispeech: an ASR corpus based on public domain audio books,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.183085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.795731Z digest=sha256:6ba88cae23ef55f417747c1a3c1f1a10c6df1b80c561a15d79ce6b61160cb82c

Observation 5d1a4c94-3f59-4a24-883d-c38a21e028bd · outbound

This paper cites Measuring Massive Multitask Language Understanding.

OpusLM: A Family of Open Unified Speech Language Models Measuring Massive Multitask Language Understanding

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.816221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.816221Z digest=sha256:aa0b78ba5ff322a5b60dd24c6bbb2c8a05b03f5dbfc189eff0fed6d357700f11

Observation 5e0c97e7-7dd4-4d1e-add7-3e9cf29eccd5 · outbound

This paper cites SALMONN: Towards generic hearing abilities for large language models,.

OpusLM: A Family of Open Unified Speech Language Models SALMONN: Towards generic hearing abilities for large language models,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:36.834754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:36.834754Z digest=sha256:432d4413ffeb9ced2be9611f42b4624cd999e77adc86ecafbcb2a9dbf8e50480

Observation 9c573230-f601-4b7c-ac62-6424680a70b1 · outbound

This paper cites Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,.

OpusLM: A Family of Open Unified Speech Language Models Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:41.025369Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.880206Z digest=sha256:71d71f296efc714c093b51e2b07819ab5921b1f52f93e31e0b26553962cbe8dc

Observation 1ee27a7c-4577-4596-9748-7656a98eb793 · outbound

This paper cites Audiolm: a language modeling approach to au- dio generation,.

OpusLM: A Family of Open Unified Speech Language Models Audiolm: a language modeling approach to au- dio generation,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.926122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.905232Z digest=sha256:46ccc79891c9745f057f12910290779b21272071ad6fa1c0c1a713f7817107c8

Observation 8b28a046-c13e-47e0-83bb-8465db3a9f11 · outbound

This paper cites Soundstream: An end-to-end neural audio codec,.

OpusLM: A Family of Open Unified Speech Language Models Soundstream: An end-to-end neural audio codec,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.834738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.954999Z digest=sha256:81a4d6fc7efe167f196dcc4aa688bcb17413002ac57b4cd3214d5ee4680c116e

Observation ec395036-1136-4f94-aa1d-8f93c6921728 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

OpusLM: A Family of Open Unified Speech Language Models Robust speech recognition via large-scale weak supervision,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.709792Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:36.993493Z digest=sha256:6d396a60cf4a57e72c78a753e7987309f27b7ac91be4840ddbea6b4027f59312

Observation e48e996f-b2a4-4258-9e71-c0d01fd405a6 · outbound

This paper cites Chattts: A generative speech model for daily dialogue.

OpusLM: A Family of Open Unified Speech Language Models Chattts: A generative speech model for daily dialogue

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.625504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.024923Z digest=sha256:b15c4d16dc5fb75a1a954374355b86fffc835423a2d378af27ded4620d71cecc

Observation 52c982af-42cf-4abd-b1fe-a57526a91a20 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

OpusLM: A Family of Open Unified Speech Language Models CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.056647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.056647Z digest=sha256:ddcd13aeec4e9670d6d62a59d48fbcc32d49aabb7ecb27f308c79fbdcf6aa58d

Observation 9e742353-f459-4b9c-ac78-b736f50fc1cf · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

OpusLM: A Family of Open Unified Speech Language Models Gemma: Open Models Based on Gemini Research and Technology

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.094892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.094892Z digest=sha256:ef271af44985b281f195059ea7e68bd0754f565a7b0aa7d774fbb57c4c964db8

Observation db665f08-39dd-412a-adc2-67c86da45994 · outbound

This paper cites SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model.

OpusLM: A Family of Open Unified Speech Language Models SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.134608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.134608Z digest=sha256:b1282ebb487179a42c803b7a7a07ec829155682fc61e900684bc5f98460e2118

Observation 85ea1877-d18b-41a0-930e-5a3f1e7bed1f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

OpusLM: A Family of Open Unified Speech Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.174496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.174496Z digest=sha256:ffb0ae58e8bf02dc186bbca7f6479db5359760307391868e49e3e773d0eb4160

Observation ca0fb67c-5e01-41e9-8158-5e48fa6eec11 · outbound

This paper cites Spirit LM: Interleaved Spoken and Written Language Model.

OpusLM: A Family of Open Unified Speech Language Models Spirit LM: Interleaved Spoken and Written Language Model

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.204906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.204906Z digest=sha256:dae5b45f8164579155fd2890f912567e41b8b4402f5e9b0784d891506b12ac42

Observation 187d76d5-0bd2-4fa4-8b85-ed7273abebba · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

OpusLM: A Family of Open Unified Speech Language Models Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.245740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.245740Z digest=sha256:b608ec0b16c92acaedc22204b4b7d5699465c7d9cca671b93bf34ddcf65f67eb

Observation 4bac999b-59ee-4a72-a9a4-2d16557f4151 · outbound

This paper cites Simple and controllable music generation,.

OpusLM: A Family of Open Unified Speech Language Models Simple and controllable music generation,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.490526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.300784Z digest=sha256:65f10b70c8560a902d416b5896797487809cde0040fdfcea6db0e72f2d3167e3

Observation 9a757072-8620-42d5-a437-5f474632bdf8 · outbound

This paper cites Yodas: Youtube-oriented dataset for audio and speech,.

OpusLM: A Family of Open Unified Speech Language Models Yodas: Youtube-oriented dataset for audio and speech,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.367605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.372656Z digest=sha256:a6713679adc8936fe60cb9c1a7654d8a2e4854ef22cf8c0fd1a80bd239e8a0d4

Observation ca97a751-3b71-4ba0-8951-a4cf453e6657 · outbound

This paper cites Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,.

OpusLM: A Family of Open Unified Speech Language Models Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.184279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.405956Z digest=sha256:6566cc25d3307def78fbd9513eca4c9d118a29722502be370662c2f604b15dfb

Observation 65ddbee9-59c0-436a-aab1-22171199b815 · outbound

This paper cites Zero: Memory optimizations toward train- ing trillion parameter models,.

OpusLM: A Family of Open Unified Speech Language Models Zero: Memory optimizations toward train- ing trillion parameter models,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:40.045832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.442538Z digest=sha256:1de78ca534aa463da3c25b4372baac446e75bf1b563cc5b1f41a6b31d257110e

Observation d9b3c04b-0266-4fb1-95c4-a650d1126fec · outbound

This paper cites PaLM: Scaling language modeling with pathways,.

OpusLM: A Family of Open Unified Speech Language Models PaLM: Scaling language modeling with pathways,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.974737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.458194Z digest=sha256:2c36f6279b5b99c26e3d6b9b0aa97d16edef6e1e409b32d332d130dee4611b4e

Observation dd4aadb3-8619-433c-bae1-7017716076b2 · outbound

This paper cites FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,.

OpusLM: A Family of Open Unified Speech Language Models FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.856931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.461483Z digest=sha256:f929cb63bae93b5613c8e53f982c25f02e1267524f9447049f61112d5a7f1d84

Observation 3fc516ab-3b33-4181-8635-6bca30a8bc91 · outbound

This paper cites Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,.

OpusLM: A Family of Open Unified Speech Language Models Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.810512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.465720Z digest=sha256:2b9b0a2009a6b8cc2658f618297c29dc14f4f6738b0353c48cf70e879d2314c2

Observation 08caaae5-b12d-4ccb-b00d-ae804b134964 · outbound

This paper cites Utmos: Utokyo-sarulab system for voicemos challenge 2022,.

OpusLM: A Family of Open Unified Speech Language Models Utmos: Utokyo-sarulab system for voicemos challenge 2022,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.766985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.468734Z digest=sha256:0dfa33ebd2958e7becb4508653a385d7e9e8277ab8b9a40bc7fb2df353e53356

Observation 65ee1f7f-35da-48d7-a95e-209464a251ed · outbound

This paper cites VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music.

OpusLM: A Family of Open Unified Speech Language Models VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.473556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.473556Z digest=sha256:72caed6175149129f9e16079ed35db67cf2fb5770ca553d1217a2186dba2b5e0

Observation a9101987-efe9-471d-ac91-c6d6b31b1f83 · outbound

This paper cites Libritts: A corpus derived from librispeech for text-to-speech,.

OpusLM: A Family of Open Unified Speech Language Models Libritts: A corpus derived from librispeech for text-to-speech,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T23:35:37.496340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:37.496340Z digest=sha256:c3cff9d213d89a0f16c4c71efff58510359a3265ec07b9a2c0eb3b37e0f7f680

Observation daa7046c-f4db-4b86-b692-c43c444eba75 · outbound

This paper cites CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,.

OpusLM: A Family of Open Unified Speech Language Models CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.691760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.500919Z digest=sha256:e0ce05e12892a5eb99a06bc32c981cb306e8d0b3de6e429bf31719005fe1589a

Observation 7a57c7ba-333d-4465-bc03-0569157b14cd · outbound

This paper cites GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,.

OpusLM: A Family of Open Unified Speech Language Models GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.673426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.509743Z digest=sha256:678f1212c2f3e1aeb41a8201b601026b6d31943ea8fb5e8d057a02b4a0a1867b

Observation 6c9ed181-5e46-4ca3-851f-922926ed02af · outbound

This paper cites Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,.

OpusLM: A Family of Open Unified Speech Language Models Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:35:39.661422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:35:37.514349Z digest=sha256:066ab8eb1d05124cbe12d30c68ac424e3b7bd480a11543142c4821de15925a53

Pith citing papers

Observation 9f94f05f-bee1-4862-8945-76bf43178963 · inbound

OpusLM: A Family of Open Unified Speech Language Models cites this paper.

OpusLM: A Family of Open Unified Speech Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 2

Resolution
malformed identifier
no resolver link, observed 2026-08-06T23:35:35.805367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:35:35.805367Z digest=sha256:7552163ee1ac8c4e9472d60ed4aadd7250d0c41b80fc1530155ec5efd6c1c3bf

Observation f7ac93b2-b13d-4169-bc04-40c1e4174723 · inbound

UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models cites this paper.

UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models OpusLM: A Family of Open Unified Speech Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T11:29:35.787283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:29:35.787283Z digest=sha256:3e90dcc1d8020b6503a568c853e983d33da1d271839be732f46eeafdd154a742

Observation 2ac87cda-fac0-4a2f-84c8-27f14ebcf149 · inbound

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis cites this paper.

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis OpusLM: A Family of Open Unified Speech Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-04T10:19:47.989537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-26T08:54:18.325054Z digest=sha256:99daf052f33574554370c2b16ac932edbb50e59f8bc78f511d5044c8901b0d04

Observation 4e7d6f72-051e-4415-8efb-3bb12206aa9f · inbound

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation cites this paper.

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation OpusLM: A Family of Open Unified Speech Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T05:07:38.317151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-07-03T05:04:23.295592Z digest=sha256:ecec1b84e775ba73ed1006800ea61ce563418053d8fc8cace3394b4215abbea1