Pith. sign in

Paper Citation Record · LEDGER

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation

As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2505.24496.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.24496 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:27:30.804516Z

measured 60 of 60 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T21:31:09.399885Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T20:16:11.072472Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved55
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c198cb4f-2277-46e4-b818-dc7780d4147a · outbound

This paper cites FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:24.325215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:24.325215Z digest=sha256:740d7b1aa6de64291eff34917ac92203148ee536e77d992374c369f34e7c53af

Observation edaab79b-3a62-4c0c-91b8-ba89f5b2d5e5 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.666030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:24.462003Z digest=sha256:d25f06ee4e721feb4a3c4df2361030ce604501016eb493c7680aab4cdc3e329e

Observation bfee4669-8a90-4c16-9f93-88822094d260 · outbound

This paper cites SyllableLM: Learning Coarse Semantic Units for Speech Language Models.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SyllableLM: Learning Coarse Semantic Units for Speech Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:24.602975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:24.602975Z digest=sha256:5c11a8780fcb6d4774fe248f74354ae1018457984e9f2470a278e2966160a941

Observation 85cca677-1b93-4b49-a515-98d54bc050b1 · outbound

This paper cites MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:27:31.591486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:24.720460Z digest=sha256:83d67e7cc5b1cc8a65dab50034cc4f0ebf649e26925e48a47afffd270d653421

Observation bebc49f9-7056-4d7b-a1a7-053c58262520 · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SoundStorm: Efficient Parallel Audio Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:24.909961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:24.909961Z digest=sha256:6a73b4ae3cd57b328dc1964485bf6d4afbe0887d467cb31610cbed79315b5a77

Observation 7cf99313-2e9f-452c-ad98-1832a9f59aad · outbound

This paper cites XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.084551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.084551Z digest=sha256:e23096c9737a86887fcdb10cc68cf660d0d2aa69b4cd9b465533dc4e98a5d458

Observation d2aea3f9-24c4-499c-ab07-bcca87572d2a · outbound

This paper cites MinMo: A Multimodal Large Language Model for Seamless Voice Interaction.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MinMo: A Multimodal Large Language Model for Seamless Voice Interaction

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.262496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.262496Z digest=sha256:0d7e8cc077ba83d6ff4070cd8b83d6195b2da01d48f8c85c80e03fbfbd568139

Observation 8bf7acdd-960c-4c94-9766-173297f31e72 · outbound

This paper cites VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.458653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.458653Z digest=sha256:f7e0e504df4279200989cb91dd6c53783cc3b0305efe0ab57bdf2cc2113c210d

Observation 6a8f3746-4c35-4145-85b4-f581da39e7d2 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.600769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.600769Z digest=sha256:f3eae66097c3bc4454659c625f4216fe9214b18ef7029c4724189a83e701e4a3

Observation ff74aab7-912a-4854-8803-81fc31d1ff0c · outbound

This paper cites 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.781504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.781504Z digest=sha256:1f74eb11d2500f2c5c496affe42c45fb4d4d1eb2cecf475290e6af29179b6ba2

Observation ac8039c6-d6e6-4c4d-a396-592356a8a347 · outbound

This paper cites Sylber: Syllabic Embedding Representation of Speech from Raw Audio.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Sylber: Syllabic Embedding Representation of Speech from Raw Audio

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.946050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.946050Z digest=sha256:4ec50ee4f5aaf1290129303e3a9c19df268ebe7ffbbad2ccd113eb55c6fd07f7

Observation 678a8410-e5f5-47eb-b1e5-fb9d8b1148b3 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.132145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.132145Z digest=sha256:d449014eb0e52d17e83abea818192af0be4597b94cda3272e4ce804cc9132056

Observation 754937e3-48ee-4aac-bf30-f7d5d76257a1 · outbound

This paper cites High Fidelity Neural Audio Compression.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation High Fidelity Neural Audio Compression

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.250366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.250366Z digest=sha256:f20808410650e7d82650cd8c010e41aa42862aa0d30607ec71f3e24447f5269a

Observation 23ee3594-44f4-489c-90d2-8113b1b7325f · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Moshi: a speech-text foundation model for real-time dialogue

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.370288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.370288Z digest=sha256:20386b4f9a74db53281f39235c9338382f84c20a6ba9f6846499f53be80faa1d

Observation fc9b3575-3c63-406e-9df8-319dba0bc389 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.503820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.503820Z digest=sha256:eada960d90b4d5c69432c73758b8585f1bf533c55217b9137628f9aa796718f4

Observation 9a9b888a-0be7-4c57-a0d2-f5ba9de84b66 · outbound

This paper cites Variable-rate discrete representation learning.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Variable-rate discrete representation learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.634866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.634866Z digest=sha256:4c70408e66ad482e5b20da1df813899e1a8f96b401d2a3e5dfe017ecd6b59f79

Observation 32b36240-57df-4b54-8520-42b0fefa9669 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.764353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.764353Z digest=sha256:c82cbf46c6e0c00190fdeffed67195996267ff793c57b29dc289496e92c14fa9

Observation e80d3b2b-0f52-4f09-91ce-94141c23eb23 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.531586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:26.848440Z digest=sha256:692b05923f24b8c1760eebd5af73b84a181e829011b204da5bd104b1cee50c08

Observation 474b2f4d-d387-4824-ac27-39948ab44abc · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.941992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.941992Z digest=sha256:49c43647cf5e6c02a3f8e17979bbc75086c2ba589d9c681f59effc6e2b0162bb

Observation 804f4053-fb7c-47a2-8cda-497b332e9879 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.086737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.086737Z digest=sha256:07e5d16e476aafe2581f6c4e9a968a51f790f930b13cedcc4e1b7eb63aa3431c

Observation b24e8798-a39f-40c1-b133-d801cb3473be · outbound

This paper cites VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.227981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.227981Z digest=sha256:6eb797fd5bb3f2e51480fb1740ee1d6efd1327f64bf9115c53e8f7494a9f1db7

Observation eac5391e-e554-4825-98e6-738d8d2b430b · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.415182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:27.360528Z digest=sha256:4626b4afb176ea77b3c58b17fc164b7d0361a2861c92164e7c70242da16e3264

Observation a8a22c26-ed85-4d7a-8176-72047c6f98a2 · outbound

This paper cites WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.428134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.428134Z digest=sha256:216966ba1ab2cd8805991edfd6d6dc6e1b515951e4749fb6b554d9a3c21a33d3

Observation 64b67d22-e821-4b10-83e8-f4dad82a4fd7 · outbound

This paper cites UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.497683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.497683Z digest=sha256:9830903e69aeb1e75cf49a5817bb8332d94e67ce0c4b901c23af22e605787a8d

Observation a4cc8cad-7112-4835-b95d-48f150541425 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.250492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:27.560168Z digest=sha256:077fc4bc9585062a92c42dc1bc4f8e167fb6a8feac474752502797ad4c71758e

Observation 13c7ab8f-b3e7-4ad4-b1fd-78eb7cf3f024 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.084950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:27.678102Z digest=sha256:a67fc92d81b58270f8b51cf8347cff636e48736b5de69a3ef0d3fe95f0e0d939

Observation bc8600bc-c246-4104-8726-e3f149b77625 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.920312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:27.798917Z digest=sha256:a9bf07b75c4fd39f5bf653b535d67b0a78bb704aa806e4b82d852281011c05af

Observation af9e4769-dff0-4dbc-8696-882fbfa1d5fe · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.763898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:27.873350Z digest=sha256:18dfd03467210f9d89f2702757a03ccfbeef01ea61fc6313fb3c7788f388b0d1

Observation cba51742-9535-4d59-9282-9d7c22eee1e2 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.598852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:27.960289Z digest=sha256:43bb793f309d2142701a3236f33b4174d603a2153c30a9a792813abe6aa63b69

Observation fd6b9d05-f1fe-4556-badc-32f6e149c0b5 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.088446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.088446Z digest=sha256:7bbe5785a93b999b778844c11036077def55ab2d4e68a5a8bc95a7453e5f4c48

Observation 409174c7-b487-4315-9c12-d8f74aa4f8fc · outbound

This paper cites MoBA: Mixture of Block Attention for Long-Context LLMs.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MoBA: Mixture of Block Attention for Long-Context LLMs

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.164670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.164670Z digest=sha256:6f9c75b4301165935d98bdbf8338a7f2363eac5088b1fb720c1c4d930dfc8cc4

Observation 11e468d2-c148-40b4-af74-958742a806e8 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.433196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:28.249212Z digest=sha256:e5d5ac18712a7bb1ee770c177e0c87c8ecee09b6a3c0b9e55dafa35002a8eace

Observation 7f4a5b07-c22b-41c6-bf22-5d42a07dcd83 · outbound

This paper cites HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.424043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.424043Z digest=sha256:097af0a8a42f3c8d812e9efe67c097dbffc4e4311b9e47dfbb7fb74add7556f1

Observation d1ec0cdd-833f-4b56-a1f9-cc5307e78352 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.492283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.492283Z digest=sha256:3943b5aff0db79b4329f4fbd99339bc4affafbe72ec08b2228b6377671563ee0

Observation d9c938da-1af9-4a58-b535-e9c9e7662bac · outbound

This paper cites VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.583954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.583954Z digest=sha256:3a7509500ef89d548833a40b8a273098ff53e66b1cc140be8605a490bb720039

Observation e970c14b-eae9-4458-9ce8-70ac03908f86 · outbound

This paper cites MLS: A Large-Scale Multilingual Dataset for Speech Research.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MLS: A Large-Scale Multilingual Dataset for Speech Research

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.670735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.670735Z digest=sha256:39379b7539fbf6d28b7ce46ff99a2fc0ae389860756be29e9b5ccf1650d451b0

Observation acf9bf34-8d6b-4cff-8e05-7c6e4a1bed9f · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 37

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.137114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:28.759042Z digest=sha256:3832cb60f560a36cd9278f42a0cd233d9fb6cccb5992a50ceac39328e8b0be23

Observation c6d42c4b-40f1-49e6-98a3-8d5b3f9d1870 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.965545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:28.833170Z digest=sha256:1eda8763b144c4b0776a25a129273ae1dd508b4240f15b72dff269c9afbadf1a

Observation 6d61baa9-d03a-428a-a061-6c8cb9922bea · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.903428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.903428Z digest=sha256:fe604f8f388f1ea8094106caf92a630ebda41ddd39f667d6c3545c34a01522c0

Observation 43042dcb-3e18-4ce3-9eeb-ba2d7105f563 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.042521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.042521Z digest=sha256:972e92a2386991f125feeb8e6591b76529353707e2409a8dfa2681b9388e4925

Observation ffb30411-f999-45e3-831b-7e0cb6e92f21 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.753480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:29.116611Z digest=sha256:221fa3400c29e2c942291f93b9a2eef63c2ff0bc2b1ef3321f0cdebe99361211

Observation 38305736-0f56-4965-b26b-c9792c6a6ce0 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.589857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:29.189410Z digest=sha256:b5a891515254f0876d4e0c2060328f71626b0bf8dfdf5108826ce25f5269fa8c

Observation 88b84e91-c007-4a5d-9186-1ade72b1f353 · outbound

This paper cites ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.295374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.295374Z digest=sha256:06067d663743a336304bfcccf8659b3e732685c3ed3d084019e526fb4344922b

Observation b079e618-c75c-4a31-acc4-37d02cfc53ea · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.285196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:29.430837Z digest=sha256:bfde347aa4730df05ae64d4e2e210bf4e61a716638d907b69be16e4cae8d77fc

Observation 4e81728e-ab1f-4880-a6ab-9b88524bc37a · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation LLaMA: Open and Efficient Foundation Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.656297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.656297Z digest=sha256:7b14c31a35ee8e852dabcc388c3d193acb66e447b6d83d06b423e26895b07056

Observation 4072c288-ec98-4003-8ff6-bdcc3fc82fba · outbound

This paper cites VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.799802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.799802Z digest=sha256:3ff49702275df04c7e7abe3a213945a12a9d3a16927295ce60f5d71446822390

Observation ee274426-26c7-41a7-83ea-6e304359fe61 · outbound

This paper cites MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.941725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.941725Z digest=sha256:83d97ec5be302f5cd2418492837b6376bb91a3e0022c30381b4f39cef96fffe3

Observation 1681cb1f-31c1-41c1-a254-49e330700f19 · outbound

This paper cites BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.047060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.047060Z digest=sha256:ba7bf747c4f680d02c9ee94ec2b2da2ccc8430ca549e37b2db2935247f1526f1

Observation 05bcfd94-028f-404c-86a9-ce88db9cb736 · outbound

This paper cites HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.136628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.136628Z digest=sha256:fe5d552421856c338b17ac9472fd2a54d146342bf263a175005415e38a8905e6

Observation e80bb3a2-ddd5-4cec-b903-be5f1ad0f61d · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:31.928376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:30.198123Z digest=sha256:5afe116b5c9045aaab4334e55a2c21995a989848b6d0a94cdf62481d7036d0e7

Observation 68424da3-44ef-427b-8bc8-191d0020f98c · outbound

This paper cites Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.294583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.294583Z digest=sha256:9d6b5abac70bd9ee15ab0a555a45a1503ac4e55d98bcc9cf841bc7eb38299a2b

Observation cd4cc1ab-fa79-4a54-947f-2a87b497e724 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:31.763814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:30.408972Z digest=sha256:95dcbd0cfb6202815c1c35abe514697ce64dd4fac4693af0577908749bbe8622

Observation 2fdcfe29-5aad-4dd9-8383-9aa86becdca2 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.480580Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.480580Z digest=sha256:6a3238f4c4e58bfad6f28cec5a375f871a146a2bd0d9d2e9c5e8f38ef3891cac

Observation 740be111-7553-461f-b72b-20d9ddaa4162 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.556326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.556326Z digest=sha256:c3882d61d0f8dfdbfc5ed87e765a2635b67a478ceac8afda94e45be835863138

Observation dbc5ac70-5974-4e85-8076-9615b6a0b18e · outbound

This paper cites SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.730309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.730309Z digest=sha256:e061f73e805b85fe2e99cfb28eb54bdb7d6d64a8aa052de68b05d2826fb8aca0

Observation d5f0d1cd-218f-4da7-ac90-59d6970cf277 · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.804516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.804516Z digest=sha256:a8d745fa234c2d3887c6ab16866d51cb020c26a9f84869d86b068245ab21aa3c

Observation fa6e1986-3774-4bbe-82ef-ebc2b9637baf · outbound

This paper cites Frontiers in Communication 3 (2018), 25.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Frontiers in Communication 3 (2018), 25

Reference 2018

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:27:33.286849Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:28.359500Z digest=sha256:4d484c19ae2cf42a6b1c291d12e5bfc82bb530d3443e69c868afc9a86fb58c99

Observation 5e6daf83-adb9-4827-9bec-cf163542bb2c · outbound

This paper cites Nature Communications 16, 1 (2025), 803.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Nature Communications 16, 1 (2025), 803

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:27:32.110037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:27:29.512154Z digest=sha256:2ff42745c2366ac512e0e2bc3fabdaa4f9bf5836924353c857970e251ce92f7d

Pith citing papers

Observation bb66ea14-8f2a-41c6-be0f-073aabe5ae2a · inbound

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification cites this paper.

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-17T00:48:45.982486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-17T00:46:08.921194Z digest=sha256:89d4e1a0d5c4bf813e5698b918991f637f9b20eb6fa8c3a046af92f36e4d8b20

Observation a6d9c15d-b53a-43b1-9aba-e28e92808ccf · inbound

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS cites this paper.

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-01T20:16:11.074055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-28T21:31:09.399885Z digest=sha256:dd9bcd823e2c15d1d6b47311001513322ee12d94a7494ec4db39e9a379fd933d