Pith. sign in

Paper Citation Record · LEDGER

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English

As of 18 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2505.17076.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.17076 v3

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:43:07.274864Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T10:13:57.724078Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

22 of 22 outbound references displayed

  • verified exact2
  • verified fuzzy9
  • unresolved10
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 21a846d2-cdd2-4376-9909-a4cf5715e0bd · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:04.468219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:04.468219Z digest=sha256:d5a1b179e39684b3d7624e1246792b0cb2232bed1658252734c4e519aebd2f7c

Observation 98c1dfae-e363-4fb1-98d3-790361e9d7d3 · outbound

This paper cites CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:04.525438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:04.525438Z digest=sha256:46956a04e5b735359a18750eec8eb408b5102c915959c5795930201aa746446c

Observation 79864f0f-c893-49f5-802e-3d94cdd45593 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:04.596328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:04.596328Z digest=sha256:1209d72c83898f836083ef39ae0317aa40512282cb494df6d0b57ad5583f6860

Observation d402c68d-3c50-4cf1-a39d-17d51ce622ae · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Moshi: a speech-text foundation model for real-time dialogue

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:04.765618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:04.765618Z digest=sha256:2ce475b08d9a201a79ed4242cb81fa71950cc68c4c63071123968252ae7bb12b

Observation c9344925-fe3d-47f6-9de6-681c54e09ec3 · outbound

This paper cites Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:04.876754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:04.876754Z digest=sha256:eb7de6b517477448757239e9bdb634e59794aab43d1f0f006b9b2374631c836d

Observation 140e13e9-533c-4fda-9fae-710e5bec802b · outbound

This paper cites GenSE: A Series of Audio Generation Models,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English GenSE: A Series of Audio Generation Models,

Reference 6

Resolution
verified exact
raw_fallback, observed 2026-08-07T15:43:08.046518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:04.967838Z digest=sha256:021b1911ae706c0a12687b59ced3f9f75d131a5ad9359692574ae8409220f495

Observation 44c14ae2-aab0-4e07-b60d-3d12d1b66ed7 · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:05.080883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:05.080883Z digest=sha256:b0a5149930262a90ab76bddb86789c169ec0f552d261b90d125f488714653f5f

Observation b4435bc8-5bbf-4d90-8269-6431442dd77c · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:05.226422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:05.226422Z digest=sha256:b2a89d02bbf4d2b77f8e3362cdcbb49496b2718942d84154608b314aea39e555

Observation 78e6ee6c-90dc-4461-9a1c-c0fdbf86a18d · outbound

This paper cites WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:05.374927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:05.374927Z digest=sha256:8f2e28d593efb654556ce6d8167d51f850004cae0d92ce563a7dc5e4bddb9b16

Observation 56e0ad82-5987-481e-82ac-daea9cbf5b87 · outbound

This paper cites SMTL: A Stratified Logic for Expressive Multi-Level Temporal Specifications.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English SMTL: A Stratified Logic for Expressive Multi-Level Temporal Specifications

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:43:07.764249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:05.456608Z digest=sha256:66628c94d643b344e03f2efb4bc20f7345405926715f18dd5637747b6587e40b

Observation 89177396-e7e2-43c4-932e-ec319e1bbae8 · outbound

This paper cites High Fidelity Neural Audio Compression.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English High Fidelity Neural Audio Compression

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:05.546290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:05.546290Z digest=sha256:efe8622afb54473b908f77e68ba2eade9669ae3968d9dc40091971fd03dd8d69

Observation cd29d5e4-fd7e-42a2-b6cb-6238da7c5199 · outbound

This paper cites SoundStream: An End-to-End Neural Audio Codec,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English SoundStream: An End-to-End Neural Audio Codec,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:10.078581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:05.683087Z digest=sha256:2c56c8956cd90d70e05c3700ba9b4a393b85704bb2e2179ce2c79b6247dec868

Observation 28d695fd-43d7-46ff-8a3d-090e9a4fe551 · outbound

This paper cites Attention is all you need,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Attention is all you need,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:09.890487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:05.915626Z digest=sha256:9332b910081587961a822dd2af65b803e3317dff68a24f5ee0f9b3057add0fa9

Observation 77b97ef8-a72e-4b57-bb9d-3e6fa480b3ad · outbound

This paper cites Neural discrete representation learning,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Neural discrete representation learning,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:09.705553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:06.049554Z digest=sha256:f79321a2347e5062ebae03c7a33769760cc3901680e7214c137884ba58e13650

Observation bd8c011f-56fb-40f6-8a36-6a36de94f288 · outbound

This paper cites Connectionist temporal classification: labelling unseg- mented sequence data with recurrent neural networks,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Connectionist temporal classification: labelling unseg- mented sequence data with recurrent neural networks,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:09.409285Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:06.241092Z digest=sha256:8562becca80be972dba9ada035959c6c7764395461f2fa14afd24d63a2f68f14

Observation 7d4b39c0-8e81-496f-92b7-eccef56ee622 · outbound

This paper cites AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:43:06.340117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:43:06.340117Z digest=sha256:7fc689c70ae367498cd4ae21ec408c5422fffdcbc53b4ffd2688c3a47db95551

Observation 2eb5f9e9-09aa-4949-8b99-a6e9bb932388 · outbound

This paper cites Librispeech: an ASR corpus based on public do- main audio books,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Librispeech: an ASR corpus based on public do- main audio books,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:09.208049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:06.554819Z digest=sha256:e001f904b804e0e18cbc4839debc9789c7290cd6a8b46a5250d592cf9537dd32

Observation d8aafd0a-cd3c-4a4b-85cd-d208cb1617ae · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Robust speech recognition via large-scale weak supervision,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:08.971715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:06.713635Z digest=sha256:078923f8e3fa5c53b3d2d579c8bb2b05a1c813fe31e1d260ca7d451a5b0682ca

Observation ba1d2e57-1294-46e5-82ce-83a13c71c556 · outbound

This paper cites StepAudio: A framework for pre-trained au- dio models training and reasoning,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English StepAudio: A framework for pre-trained au- dio models training and reasoning,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:08.726633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:06.864778Z digest=sha256:2499dc68f60025bc84be68d9586818ccc36b7f88442087b3d1b64d3444b5bdd3

Observation b997a9c4-edb4-44f9-80d3-942ff55a5ebb · outbound

This paper cites Characterizing Polkadot's Transactions Ecosystem: methodology, tools, and insights.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Characterizing Polkadot's Transactions Ecosystem: methodology, tools, and insights

Reference 20

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T15:43:07.563131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:06.984573Z digest=sha256:cc55faa5f46b93cd8b34f927dc31f1227d1859e2b7663f9e4f995ba9ba7733ea

Observation 33c999dd-1326-467f-86e1-1f932a255f1e · outbound

This paper cites A three-layered model for expressive speech perception,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English A three-layered model for expressive speech perception,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:08.525743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:07.126002Z digest=sha256:472ee53fc94c1ca72dd17263931bcc098627d693857d62f262559f17ba71c145

Observation 63460d8c-dfcf-4b75-813b-993897525a1b · outbound

This paper cites Tone recognition in Mandarin Chinese using convolutional neural networks,.

Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English Tone recognition in Mandarin Chinese using convolutional neural networks,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:43:08.297050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T15:43:07.274864Z digest=sha256:d91e2af7d546b10f3039687a22b43c9dd89a42ad8281fe9ad642ef70d20f020a

Pith citing papers

Observation d6e5ce31-033b-4fde-86cd-ac72e05ad0a5 · inbound

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition cites this paper.

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T10:13:57.724078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T10:13:57.724078Z digest=sha256:e5c2bbe67d1f7406a27fe27fb21a318e47f9f7cecb166a00bc15ae29bd4d2c92