Pith. sign in

Paper Citation Record · LEDGER

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation

As of 16 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2505.24496.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.24496 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:27:30.804516Z

measured 60 of 60 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T21:31:09.399885Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T20:16:11.072472Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved55
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c198cb4f-2277-46e4-b818-dc7780d4147a · outbound

This paper cites FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:24.325215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:24.325215Z digest=sha256:56477686242c9822de29f391548a54569316285cb588ebf3d42c46d219d75813

Observation edaab79b-3a62-4c0c-91b8-ba89f5b2d5e5 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.666030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:24.462003Z digest=sha256:73538c3cebbd1b5a23690e3bfc75f712d938ee82917372937fda0b5407c0c87a

Observation bfee4669-8a90-4c16-9f93-88822094d260 · outbound

This paper cites SyllableLM: Learning Coarse Semantic Units for Speech Language Models.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SyllableLM: Learning Coarse Semantic Units for Speech Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:24.602975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:24.602975Z digest=sha256:68757b5f84a38af1b823301f0b35a2ed0b7d532cbf1dd500ab09c4a127ce7dbd

Observation 85cca677-1b93-4b49-a515-98d54bc050b1 · outbound

This paper cites MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MARS6: A Small and Robust Hierarchical-Codec Text-to-Speech Model

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:27:31.591486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:24.720460Z digest=sha256:a94644548d2ae390e75f90af9366cb1c924ed9d48b44f6f2445e7d09bdda75d7

Observation bebc49f9-7056-4d7b-a1a7-053c58262520 · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SoundStorm: Efficient Parallel Audio Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:24.909961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:24.909961Z digest=sha256:69c57f4f43f36ba2019b43651d71fdaa0eb2e492a533607ff2a2d6784868339d

Observation 7cf99313-2e9f-452c-ad98-1832a9f59aad · outbound

This paper cites XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.084551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.084551Z digest=sha256:1de9873931f19808a42fd89d1d2be2b5a5a1628c8b50b3b0aa1da809df7afe9f

Observation d2aea3f9-24c4-499c-ab07-bcca87572d2a · outbound

This paper cites MinMo: A Multimodal Large Language Model for Seamless Voice Interaction.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MinMo: A Multimodal Large Language Model for Seamless Voice Interaction

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.262496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.262496Z digest=sha256:7daaea7750d639d70783a6d0780d64616eef57e7818c824846d53c65b5f8afb8

Observation 8bf7acdd-960c-4c94-9766-173297f31e72 · outbound

This paper cites VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.458653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.458653Z digest=sha256:e9d85a4c479561237cb4a935b6363c4f3593649437272cb1ca4e29cc0ba5e02d

Observation 6a8f3746-4c35-4145-85b4-f581da39e7d2 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.600769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.600769Z digest=sha256:3523869f3506f3437e2c934027ea0c93e4eae0c3c628789f4c55a819f5d4f319

Observation ff74aab7-912a-4854-8803-81fc31d1ff0c · outbound

This paper cites 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.781504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.781504Z digest=sha256:8a521f7c05e52336f1f44b3d1d848af8b2a2c80df1f9d99ab07783ceac2958f2

Observation ac8039c6-d6e6-4c4d-a396-592356a8a347 · outbound

This paper cites Sylber: Syllabic Embedding Representation of Speech from Raw Audio.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Sylber: Syllabic Embedding Representation of Speech from Raw Audio

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:25.946050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:25.946050Z digest=sha256:354b369ee582a621b9b517b81b69d168a58b0103ad44c1fdc352019ffcca5b36

Observation 678a8410-e5f5-47eb-b1e5-fb9d8b1148b3 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.132145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.132145Z digest=sha256:272ef4c20de163b517f4148b9d6bb14bf9598fbd22d2eb68305abcd061a70e22

Observation 754937e3-48ee-4aac-bf30-f7d5d76257a1 · outbound

This paper cites High Fidelity Neural Audio Compression.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation High Fidelity Neural Audio Compression

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.250366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.250366Z digest=sha256:dde2d8931f5726fcbbe38cb17fa0a3d6ccfe932bb536979f9a44eb1eab27fc14

Observation 23ee3594-44f4-489c-90d2-8113b1b7325f · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Moshi: a speech-text foundation model for real-time dialogue

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.370288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.370288Z digest=sha256:9c45c2cee4580d2a34a52386c9ce8f98db99d0ec76160265787aa8502e5e8c97

Observation fc9b3575-3c63-406e-9df8-319dba0bc389 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.503820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.503820Z digest=sha256:bdcbb1597e0d15176acfd7746cbe6a3f13541d104be394cb434b79162ecf2d6d

Observation 9a9b888a-0be7-4c57-a0d2-f5ba9de84b66 · outbound

This paper cites Variable-rate discrete representation learning.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Variable-rate discrete representation learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.634866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.634866Z digest=sha256:c5cd9404b75a975ce2320b94d78450d3d2bfffa67dcd24e36fc08e439f3d2bdd

Observation 32b36240-57df-4b54-8520-42b0fefa9669 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.764353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.764353Z digest=sha256:700895761cd7987217820dc608bb6c3d46e2cd74fd20682c76d10bde24c016c0

Observation e80d3b2b-0f52-4f09-91ce-94141c23eb23 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.531586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:26.848440Z digest=sha256:8f91989dfbddaeac7ea9aeef8474b6a7dec89667d776b98b475d9422609a0313

Observation 474b2f4d-d387-4824-ac27-39948ab44abc · outbound

This paper cites VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:26.941992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:26.941992Z digest=sha256:ab6a01db25c8f469a12570e324a3709e28776d72f7a2abdb72d683375f9bf5dd

Observation 804f4053-fb7c-47a2-8cda-497b332e9879 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.086737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.086737Z digest=sha256:31ed799f02cb2408afa85278ac297ea8794e4944704645ed7e2bef0e4c98c4ab

Observation b24e8798-a39f-40c1-b133-d801cb3473be · outbound

This paper cites VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.227981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.227981Z digest=sha256:3641d3c17a268ab20c55977ccc07f6bb0d32fb740392f4166e100e1f8421b81d

Observation eac5391e-e554-4825-98e6-738d8d2b430b · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.415182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:27.360528Z digest=sha256:7b0f0aecc54620a5c627311a942e74dd6972a66226f861bfaa08c67fcf82deb8

Observation a8a22c26-ed85-4d7a-8176-72047c6f98a2 · outbound

This paper cites WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.428134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.428134Z digest=sha256:a4e501243106f3a6bb5a0961cf2ed02a85f6916f6886f5871d1d7a1f086ec304

Observation 64b67d22-e821-4b10-83e8-f4dad82a4fd7 · outbound

This paper cites UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:27.497683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:27.497683Z digest=sha256:ddda6beb3e5506484e8d5de70393435525212387aeba39be3442f83c2e88ce88

Observation a4cc8cad-7112-4835-b95d-48f150541425 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.250492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:27.560168Z digest=sha256:a2c2f8ea77d3fd9e6d8443159e8af01616e48c29f9742b1867c8919d96665c43

Observation 13c7ab8f-b3e7-4ad4-b1fd-78eb7cf3f024 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:34.084950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:27.678102Z digest=sha256:d758706a17fa75bdece9eef83e37473476689b029a2d8b9d7afbf56542623bd6

Observation bc8600bc-c246-4104-8726-e3f149b77625 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.920312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:27.798917Z digest=sha256:d21c1dc50ea252cd7f8806932fcd261666ea4d01cc9aad456a25db43366d7480

Observation af9e4769-dff0-4dbc-8696-882fbfa1d5fe · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.763898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:27.873350Z digest=sha256:10f050ff5573b8b933c7123f09ceae99c5881f942e2d87db14b0f63e772a2966

Observation cba51742-9535-4d59-9282-9d7c22eee1e2 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.598852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:27.960289Z digest=sha256:9d5ab738a09fe489012c97eecb36a4b5d6b49467b94d7b05526734702eaf7e24

Observation fd6b9d05-f1fe-4556-badc-32f6e149c0b5 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.088446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.088446Z digest=sha256:c5a819a5950a2607cd091f18cf4c540ea6197581e2865ea0e3915ab5e0d5c1d1

Observation 409174c7-b487-4315-9c12-d8f74aa4f8fc · outbound

This paper cites MoBA: Mixture of Block Attention for Long-Context LLMs.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MoBA: Mixture of Block Attention for Long-Context LLMs

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.164670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.164670Z digest=sha256:8f67618962448cc6a533ea8f7e0a7a41861c0fd9ec4f59ab63660b51f06c8698

Observation 11e468d2-c148-40b4-af74-958742a806e8 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.433196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:28.249212Z digest=sha256:4c8391906bf2d34d6544f019da90f8690e5e3822974f82927dfb1664efc7921c

Observation 7f4a5b07-c22b-41c6-bf22-5d42a07dcd83 · outbound

This paper cites HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.424043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.424043Z digest=sha256:631560d48e0f4bd27de413e83d3324fa73fe72a41d1fe73ecf9eefa05a17bc1d

Observation d1ec0cdd-833f-4b56-a1f9-cc5307e78352 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.492283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.492283Z digest=sha256:5cca579e80157f8e8740bcaff06eabe7edd683b4b2deaff2b67784a6c8dda43c

Observation d9c938da-1af9-4a58-b535-e9c9e7662bac · outbound

This paper cites VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.583954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.583954Z digest=sha256:fdbb6800cf317449fd158a5554ed67bf9b68adef7cc04ecbdcad80ee96a09944

Observation e970c14b-eae9-4458-9ce8-70ac03908f86 · outbound

This paper cites MLS: A Large-Scale Multilingual Dataset for Speech Research.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MLS: A Large-Scale Multilingual Dataset for Speech Research

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.670735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.670735Z digest=sha256:cb6dcd779d706a0bb519facbb4dafe1376523a75925c1afd079b0c2393c87186

Observation acf9bf34-8d6b-4cff-8e05-7c6e4a1bed9f · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 37

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:33.137114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:28.759042Z digest=sha256:1fc4434870e0d2da272361ee121a87326f058fe42027996f0199594a99828cc4

Observation c6d42c4b-40f1-49e6-98a3-8d5b3f9d1870 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.965545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:28.833170Z digest=sha256:5f38fac8218ad436d95a7cc534c16efe7ac88c8a6d011325f31da9a138f6e10c

Observation 6d61baa9-d03a-428a-a061-6c8cb9922bea · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:28.903428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:28.903428Z digest=sha256:99eb838ba596f04763fe72756d1fa08ff7478e87f02b7d2f96d425999bd4abd4

Observation 43042dcb-3e18-4ce3-9eeb-ba2d7105f563 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.042521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.042521Z digest=sha256:2eedcf90d456c47ae925bb64a42d3e92d120044b0e733314701d26ac05ce97c2

Observation ffb30411-f999-45e3-831b-7e0cb6e92f21 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.753480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:29.116611Z digest=sha256:a310352c6d0da9515030cffd6af2ad08744d636cbd91a22290185307ede4b00e

Observation 38305736-0f56-4965-b26b-c9792c6a6ce0 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.589857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:29.189410Z digest=sha256:e53b9709fab82586d3375bbb67293091fa894cbcbceda81c10a2a3e8406a326d

Observation 88b84e91-c007-4a5d-9186-1ade72b1f353 · outbound

This paper cites ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.295374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.295374Z digest=sha256:9057bbbd5646f86c2077c4f7945f356c7c500ae6f7ae707cb3a2e05bcd2a3e21

Observation b079e618-c75c-4a31-acc4-37d02cfc53ea · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:32.285196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:29.430837Z digest=sha256:e018a14496ca95b1d2882e70cc2ba8361fe81db07a55897de56dfc1a951b1a53

Observation 4e81728e-ab1f-4880-a6ab-9b88524bc37a · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation LLaMA: Open and Efficient Foundation Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.656297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.656297Z digest=sha256:ede80a2a93c6d48f1b43149f18f3f93e02caf15081ea8c765f509d8aa4de86d1

Observation 4072c288-ec98-4003-8ff6-bdcc3fc82fba · outbound

This paper cites VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.799802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.799802Z digest=sha256:3ca917158ba1c85cf1e546cc563477f5046841b84e5b6a653fcb85f923dadf24

Observation ee274426-26c7-41a7-83ea-6e304359fe61 · outbound

This paper cites MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:29.941725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:29.941725Z digest=sha256:35bb19e404ceacf8013b687b24b554f0815cc26c33c3a41e245aa131273f768d

Observation 1681cb1f-31c1-41c1-a254-49e330700f19 · outbound

This paper cites BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.047060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.047060Z digest=sha256:63dd15127490364e63b57e72857c16357b75e1b3b089b5cda276306e2cb1f2a4

Observation 05bcfd94-028f-404c-86a9-ce88db9cb736 · outbound

This paper cites HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.136628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.136628Z digest=sha256:2e29c8c323730e5859a4973fe22c667e8eba625eb64b7f9aa00764244bb5dad1

Observation e80bb3a2-ddd5-4cec-b903-be5f1ad0f61d · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:31.928376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:30.198123Z digest=sha256:5ec6e2278de23fa2ccdac257e5d325f79def991a28f96d1cd4afccd6ab9bcba3

Observation 68424da3-44ef-427b-8bc8-191d0020f98c · outbound

This paper cites Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.294583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.294583Z digest=sha256:5f6c499cb1158b05bc663de0d9ed5ac7dd2c12b1fc55a7836d88b994ef919c38

Observation cd4cc1ab-fa79-4a54-947f-2a87b497e724 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-07T12:27:31.763814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:30.408972Z digest=sha256:c61855d7c45f301566c1028b8ddf2fbf91e48c2d21b5e9b8691815252f03282e

Observation 2fdcfe29-5aad-4dd9-8383-9aa86becdca2 · outbound

This paper cites an unresolved cited work.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.480580Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.480580Z digest=sha256:156e1829662381a052f7cc36309f4c1caaafb2d0fbae026494c21d387bd8c6db

Observation 740be111-7553-461f-b72b-20d9ddaa4162 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.556326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.556326Z digest=sha256:845caa81c14fa7dd8d3323c5c737bb7e555802d2d03a7813e677bd22a4915193

Observation dbc5ac70-5974-4e85-8076-9615b6a0b18e · outbound

This paper cites SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.730309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.730309Z digest=sha256:44414bd2a056f61ce9f7134b238487ff351e881a97bd4aa622fef1f032c9da70

Observation d5f0d1cd-218f-4da7-ac90-59d6970cf277 · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:30.804516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:30.804516Z digest=sha256:973f258571422c6c0205e3684e220c9db915c2dfc22c2f8c8e4b155c6200f3cd

Observation fa6e1986-3774-4bbe-82ef-ebc2b9637baf · outbound

This paper cites Frontiers in Communication 3 (2018), 25.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Frontiers in Communication 3 (2018), 25

Reference 2018

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:27:33.286849Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:28.359500Z digest=sha256:153c02db16a418967f4bd9755a8b7745c4f8d65b5964861b98442ce6b9c5e845

Observation 5e6daf83-adb9-4827-9bec-cf163542bb2c · outbound

This paper cites Nature Communications 16, 1 (2025), 803.

Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation Nature Communications 16, 1 (2025), 803

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:27:32.110037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T12:27:29.512154Z digest=sha256:f99296f0804ce050dba8444f42d24290aa34116c5946456ac8c337694398e81a

Pith citing papers

Observation bb66ea14-8f2a-41c6-be0f-073aabe5ae2a · inbound

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification cites this paper.

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-17T00:48:45.982486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=arxiv_source observed=2026-05-17T00:46:08.921194Z digest=sha256:3f39d21b8f99a9b952f4a2abd2bbf81f2dda15474b70c4c4711f0999963cd4b2

Observation a6d9c15d-b53a-43b1-9aba-e28e92808ccf · inbound

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS cites this paper.

Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-01T20:16:11.074055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-06-28T21:31:09.399885Z digest=sha256:9f57d82fea196662098922024cbcf36252588cbc4f1ba08ba7e859f861641e53