{"as_of":"2026-08-15T05:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5374e8e1127d325dad1248e2e2f11765b9b9ae9c7a5e3d26a49b4ae31ba35bf","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:10:56.287904Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:10:55.955561Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:37:06.833872Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05835","snapshot_observed_at":"2026-08-05T23:10:55.955561Z","title":"These technologies have been central to fields such as audio transmission and commu- nication [1, 2]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:55.955561Z"},"links":{"cited_paper":"/paper/2508.05835","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:be9a41871bdb0014587a5f67841cf79a230b970d2b4c9f5d8a30876ed63514f7","observation_id":"afbe7124-0d3e-4167-9392-d6f72758aec9","resolution":{"observed_at":"2026-08-05T23:10:55.955561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.05835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05835","snapshot_observed_at":"2026-07-02T15:37:06.833872Z","title":"Nanocodec: Towards high-quality ultra fast speech llm inference,","venue":null,"work_id":"528ed2fe-b764-4210-925d-6414ac6e3b72","year":2025},"citing_paper":{"arxiv_id":"2606.06559","last_updated":"2026-06-04T12:39:44Z","snapshot_observed_at":"2026-08-12T18:53:54.395143Z","submitted_at":"2026-06-04T12:39:44Z","title":"IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T23:42:38.203116Z"},"links":{"cited_paper":"/paper/2508.05835","citing_paper":"/paper/2606.06559"},"observation_digest":"sha256:b1f51ff837e1de08faf50408d270d0be348b6b7eb347dcaa134455df52339f7b","observation_id":"c7f0061e-029f-431c-abeb-369b2b61afba","resolution":{"observed_at":"2026-07-02T15:37:06.835221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05835/citation-record","integrity":"/paper/2508.05835/integrity","json":"/paper/2508.05835/citation-record.json","paper":"/paper/2508.05835"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05835","snapshot_observed_at":"2026-08-05T23:10:55.955561Z","title":"These technologies have been central to fields such as audio transmission and commu- nication [1, 2]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:55.955561Z"},"links":{"cited_paper":"/paper/2508.05835","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:be9a41871bdb0014587a5f67841cf79a230b970d2b4c9f5d8a30876ed63514f7","observation_id":"afbe7124-0d3e-4167-9392-d6f72758aec9","resolution":{"observed_at":"2026-08-05T23:10:55.955561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.683197Z","title":"The model consists of a fully convolutional generator network and three discriminators","venue":null,"work_id":"a4b01a91-26d0-4449-a88d-424748073827","year":2016},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.067955Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:42aa053d9a773097c7f96368e2e4dee38b035e91cbd36472dc5aee50de773f28","observation_id":"950b9b12-3f78-41ed-b821-de60d59ddb26","resolution":{"observed_at":"2026-08-05T23:10:56.685548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.676920Z","title":"Experiments setup To assess the performance of our codec in comparison to the LFSC and explore the effects of bitrate reduction, we adopted Koel-TTS [4], a SOTA LLM-based TTS model","venue":null,"work_id":"ece5304e-f00a-4475-9b3a-6a72becb0c9c","year":null},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.139531Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:b7c7222ec3f1280d79ae1cef1a1a2ecb9f5ee0504bc141dd4567b9279f9d4307","observation_id":"00d527d4-1350-40fd-9c23-cfa6c288af9a","resolution":{"observed_at":"2026-08-05T23:10:56.679227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.670171Z","title":"Ex- perimental results demonstrate that NanoCodec surpasses exist- ing approaches at the same bitrate, offering significantly higher intelligibility and speaker similarity","venue":null,"work_id":"a11d7656-cdc8-4fcb-a5c1-4bacd15c19ce","year":null},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.189328Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:5b6fbc72792984d8e12c0ae25d945c4780846a8a71b5bccf91a5dbc971645ad6","observation_id":"1071ceec-89b6-4776-a3a9-4b234389f202","resolution":{"observed_at":"2026-08-05T23:10:56.672746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.194681Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.194681Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:bc520234fde32943eb2bda4961c126764dc8817e6793fb93b86faa73a8f46503","observation_id":"da807057-629e-4b7a-94b7-262b0f5dec08","resolution":{"observed_at":"2026-08-05T23:10:56.194681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.662563Z","title":"Low frame-rate speech codec: a codec designed for fast high-quality speech llm training and in- ference,","venue":null,"work_id":"643527c5-6d10-4d4b-abf9-2e699da2a2b1","year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.206648Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:139b17c88c05c76ba080161b64a8eebe866b9aa89bbabf84b57b9c67cdc94741","observation_id":"041a70a0-4a23-48a0-99ff-73da461ceeda","resolution":{"observed_at":"2026-08-05T23:10:56.665414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-15T00:22:53.406062Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T23:10:56.208858Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.208858Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:62f63d5d025ce432e714210028a5a2ee010e700af65fa5d9df993b7a1872ec58","observation_id":"cdd5867a-8a93-41d2-8127-0046701c044a","resolution":{"observed_at":"2026-08-05T23:10:56.208858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05236","last_updated":"2025-07-22T21:32:13Z","snapshot_observed_at":"2026-08-08T21:47:45.872410Z","submitted_at":"2025-02-07T06:47:11Z","title":"Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05236","snapshot_observed_at":"2026-08-05T23:10:56.211282Z","title":"Koel- tts: Enhancing llm based speech generation with preference alignment and classifier free guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.211282Z"},"links":{"cited_paper":"/paper/2502.05236","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:33f06aca7252393c10a7d5e9f8a63c313a9c9c2c5284a8e8bdc566b5de874725","observation_id":"cb8e12ee-b1fe-442a-829c-e1dedd053d87","resolution":{"observed_at":"2026-08-05T23:10:56.211282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.655936Z","title":"Textless direct speech-to-speech translation with discrete speech representation,","venue":null,"work_id":"d6ebee52-c8ab-4459-a706-a6eb63638322","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.215402Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:ab18ee50e6841d95b41746f751001ee81a1bd563c5d82ab17a8df7965dd32a88","observation_id":"eb2b600d-3793-4d62-885d-b5c9278f1c04","resolution":{"observed_at":"2026-08-05T23:10:56.658223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01831","last_updated":"2024-08-18T19:30:30Z","snapshot_observed_at":"2026-08-13T10:41:46.860711Z","submitted_at":"2023-08-03T15:47:04Z","title":"Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation","version":2},"cited_work":{"arxiv_id":"2308.01831","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.01831","snapshot_observed_at":"2026-08-05T23:10:56.408520Z","title":"Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation","venue":"cs.CL","work_id":"b2d94207-4917-4365-8751-b7679a56d9de","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.217391Z"},"links":{"cited_paper":"/paper/2308.01831","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:1bf5c0d0dc9069c9192e2cf6f3e1eb92fc6094c7694e787278df019dc28fccf8","observation_id":"382689a3-48e7-4480-a2a2-89ac25cc526a","resolution":{"observed_at":"2026-08-05T23:10:56.411058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.220079Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.220079Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:65548741295012f8babc43dbf1816dd39dd75ebe5799cc63117c5cec05016cf4","observation_id":"7dc6b11d-0f94-4ca5-ab33-6a4a53bb0b60","resolution":{"observed_at":"2026-08-05T23:10:56.220079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T23:10:56.222307Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.222307Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:94b43b71db17eedd1664d6aaab6e684fcd80ba9ee7023550cd0336827f6577d5","observation_id":"af937a02-c454-42b9-975e-0e3e05475f9b","resolution":{"observed_at":"2026-08-05T23:10:56.222307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05298","last_updated":"2025-06-04T16:25:54Z","snapshot_observed_at":"2026-08-12T23:47:31.683891Z","submitted_at":"2024-06-07T23:47:51Z","title":"Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05298","snapshot_observed_at":"2026-08-05T23:10:56.224674Z","title":"Spectral codecs: Spectrogram-based audio codecs for high quality speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.224674Z"},"links":{"cited_paper":"/paper/2406.05298","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:f40b54a3b5bc5688dcfda6444a5d69b97cd9606c2d6551c988b5cde584acf526","observation_id":"08f35b59-de99-4771-8b28-d71248dd34db","resolution":{"observed_at":"2026-08-05T23:10:56.224674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.644727Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"72a29edf-aefa-46fe-9f16-51b1c089d759","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.227519Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:e1bc8fceb86ea6f8f42cbf9c38ffe0f3fd60feb58e2aa93c20f3bd04eda52c51","observation_id":"98dd2d26-f5d8-442b-94b8-d74a8a45555b","resolution":{"observed_at":"2026-08-05T23:10:56.647619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.638527Z","title":"A review of vector quantization tech- niques,","venue":null,"work_id":"d54d73bb-796c-46bc-adad-7ef8367145d1","year":2006},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.229337Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:e47000a09ffa51da83c696f4ce7f11008264e18dcc931cf7d4dd38a87655b9d5","observation_id":"b8db2c80-77b2-4d36-8c80-3fa3b8123f85","resolution":{"observed_at":"2026-08-05T23:10:56.640927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04947","last_updated":"2024-06-07T07:03:30Z","snapshot_observed_at":"2026-08-14T22:24:45.733821Z","submitted_at":"2024-04-07T12:57:46Z","title":"Gull: A Generative Multifunctional Audio Codec","version":2},"cited_work":{"arxiv_id":"2404.04947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.04947","snapshot_observed_at":"2026-08-05T23:10:56.385800Z","title":"Gull: A Generative Multifunctional Audio Codec","venue":"eess.AS","work_id":"94bf9f3c-15be-412c-9a45-5551a96676af","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.231159Z"},"links":{"cited_paper":"/paper/2404.04947","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:8ae366cfd412e78a62386ca6a7f0c3332864954c801c427e0ad62baa6b4abebf","observation_id":"0d1a7139-afcd-4cd2-b250-22d6d087fde8","resolution":{"observed_at":"2026-08-05T23:10:56.388140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-05T23:10:56.233173Z","title":"Fi- nite scalar quantization: Vq-vae made simple,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.233173Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:546ff68aab80fdb0369282e90b1e62d1360a52834310ddd3d0c5993ec87fcb01","observation_id":"b73d46e2-9f29-439a-baa1-99d6ee3c5405","resolution":{"observed_at":"2026-08-05T23:10:56.233173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01271","last_updated":"2024-02-02T09:55:15Z","snapshot_observed_at":"2026-08-14T10:20:13.075012Z","submitted_at":"2024-02-02T09:55:15Z","title":"An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec","version":1},"cited_work":{"arxiv_id":"2402.01271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01271","snapshot_observed_at":"2026-08-05T23:10:56.371999Z","title":"An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec","venue":"eess.AS","work_id":"494fc8a4-f771-4814-b7b3-5d89a6d84e4c","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.235309Z"},"links":{"cited_paper":"/paper/2402.01271","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:47a71245bb95ee0a0abd1444feba568e942d1890ce64f2cf66d135aefdc9c68b","observation_id":"f2c4ada4-b184-455f-a5e6-262eccd6eb1a","resolution":{"observed_at":"2026-08-05T23:10:56.374626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.631827Z","title":"Lightcodec: A high fidelity neural audio codec with low computation complexity,","venue":null,"work_id":"71d77b08-df98-4a3d-b758-eb43b1bcbcf2","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.238212Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:88cd5b27a45db153a00ac541449afe9850f909255655e44e68d55110cf29b536","observation_id":"6b674d29-0816-4322-a2d0-533578fbaf82","resolution":{"observed_at":"2026-08-05T23:10:56.634342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-12T22:55:11.320450Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-05T23:10:56.240257Z","title":"Wavtokenizer: an efficient acous- tic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.240257Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:bdae80e212b85edbf6ab8c6784fb6e2f9a49c27d1ecf8bc04890a024c936f51c","observation_id":"512474a8-203f-478d-a365-a76c09d1c7a8","resolution":{"observed_at":"2026-08-05T23:10:56.240257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-08-13T15:53:14.922964Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-05T23:10:56.242612Z","title":"Scaling transformers for low-bitrate high-quality speech coding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.242612Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:745e274a70216ad3e42921eab86768d1db307d44db367e1d01865e34aff617af","observation_id":"455d23af-0459-42ad-a8ba-04e35a6f588a","resolution":{"observed_at":"2026-08-05T23:10:56.242612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-14T19:39:52.001362Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-08-05T23:10:56.245021Z","title":"Ts3-codec: Transformer-based simple streaming single codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.245021Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:df688ad7ff22ed3bbcf9934b5b0268917d1c47a7e4a1d0ad7b64689c169a648d","observation_id":"57bf441b-e926-4c19-b4de-a6a7246a0672","resolution":{"observed_at":"2026-08-05T23:10:56.245021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T23:10:56.247368Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.247368Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:b28a7fd564d3ec4d829d236280589780839ef0efeec14abd91552aec36fefa47","observation_id":"bd81f46b-8c0e-4f37-a382-a856d0f0ee25","resolution":{"observed_at":"2026-08-05T23:10:56.247368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.624738Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"8ce67312-1139-45d3-8a3b-ff686f00cd65","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.250042Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:b684d9f41a46180724c63d4a0001a1c68ec30e93955ae151d0d72e06fd0d5ca1","observation_id":"29b9e15f-b0e8-4e70-bd45-72558da1b789","resolution":{"observed_at":"2026-08-05T23:10:56.627122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-14T20:49:18.244309Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-05T23:10:56.252891Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.252891Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:806e1e478c25e0f731f491b54aa417f104af3532b8d42891bbacefe10e879ba9","observation_id":"1df455ea-20ce-4795-9461-174ffa8818ab","resolution":{"observed_at":"2026-08-05T23:10:56.252891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.618735Z","title":"Neural networks fail to learn periodic functions and how to fix it,","venue":null,"work_id":"6752b7d8-c176-4a6e-ad33-ef7dcaae1d14","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.254974Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:0d8ba670500519c5abd649718858c061d3ca4aea1363c956c24a769ddcd5f4f4","observation_id":"4ea94944-4489-48f0-ab34-9ca420020909","resolution":{"observed_at":"2026-08-05T23:10:56.620984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.611736Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":"2911c13d-3d09-4130-8fab-a364dd5519d9","year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.256910Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:359d3e059dd3732dc1689c604f61ef3dce4925dd2c96889ad07dd84eeba4e691","observation_id":"cea6704d-f41a-46f7-8b31-a4168a2226cd","resolution":{"observed_at":"2026-08-05T23:10:56.614682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14153","last_updated":"2020-09-29T16:55:25Z","snapshot_observed_at":"2026-08-13T21:28:34.960895Z","submitted_at":"2020-09-29T16:55:25Z","title":"Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020","version":1},"cited_work":{"arxiv_id":"2009.14153","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.14153","snapshot_observed_at":"2026-08-05T23:10:56.330596Z","title":"Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020","venue":"eess.AS","work_id":"4011d01d-9404-46d7-bc5f-fef98c7f60a4","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.258791Z"},"links":{"cited_paper":"/paper/2009.14153","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:a05f510b262e3b1b986873fcc8d5f2e510a94a9e4cee44a643e4eaea03569103","observation_id":"912a39d0-ea31-4003-acb5-997a139fb7f2","resolution":{"observed_at":"2026-08-05T23:10:56.334788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.605359Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":"8e92be31-e2d4-446d-aee4-2c0ddf395033","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.261856Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:e007479751b3ef373d3a9f07bcd3bd171dce29aaf2724b8920a888fa66d21d59","observation_id":"9335ac55-5526-457e-9425-ac90053154d3","resolution":{"observed_at":"2026-08-05T23:10:56.607413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T23:10:56.264700Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.264700Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:3894dc9fd191ad775b16dc6436e59c0fb3ef87bd99765dfe24688c264be65075","observation_id":"ff21f246-be34-40a2-b339-0ee3f54b5f07","resolution":{"observed_at":"2026-08-05T23:10:56.264700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.598512Z","title":"Torchaudio-squim: Reference-less speech quality and intelligibility measures in torchaudio,","venue":null,"work_id":"cd35e613-b3b8-4e4a-8dff-a36f93fe0cc4","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.266976Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:2d023f5bacb492c5f2750272e36d3e51a9c02cb5e8b6dfea56f2888f46f1715c","observation_id":"5a4923fe-b2a9-459b-8a89-88c0e246b249","resolution":{"observed_at":"2026-08-05T23:10:56.601009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.268724Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.268724Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:727854c356cbffdb05fab925e90b97466a16729bf5441afea1aa5f56f43014b5","observation_id":"b090c511-9542-4e1e-a2e8-729a4a897822","resolution":{"observed_at":"2026-08-05T23:10:56.268724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.587571Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"363dd265-8c11-499c-9a36-829d9275f13c","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.271336Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:a3037eec8f332d3021c8e4d85f99ab1f1a2f562342423ea25d2ab3b962b6a087","observation_id":"658ec4c7-6634-45e4-ac4e-9885b6aeb717","resolution":{"observed_at":"2026-08-05T23:10:56.590353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08342","last_updated":"2024-01-16T13:17:39Z","snapshot_observed_at":"2026-08-14T14:13:15.613627Z","submitted_at":"2024-01-16T13:17:39Z","title":"ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings","version":1},"cited_work":{"arxiv_id":"2401.08342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08342","snapshot_observed_at":"2026-08-05T23:10:56.307604Z","title":"ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings","venue":"eess.AS","work_id":"0c597f97-4b41-4f39-93ff-0bf9a81548c9","year":2024},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.273816Z"},"links":{"cited_paper":"/paper/2401.08342","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:7c8bb92c48d3e7f2f3c1c45dc6c3a1fff94cb05060501720b4b19fd3789f077a","observation_id":"22a2993b-9a5a-4372-af1a-dc1c1044f70f","resolution":{"observed_at":"2026-08-05T23:10:56.312611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.581140Z","title":"Roach, A little encyclopaedia of phonetics","venue":null,"work_id":"316ccee2-f615-4267-99f3-d6b6d96652ba","year":2002},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.276404Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:04b2726307d9c7f5f5936b389b745886995b0b42dea3adef6b4155a3e3bbd13f","observation_id":"bb215012-18e3-4741-80c6-34cf59db1d03","resolution":{"observed_at":"2026-08-05T23:10:56.583466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.571523Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"edcf7d8c-5557-4665-9baa-9e5246b1202d","year":2019},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.278728Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:ea4832fbf1f86529baefb715fbb86727e895670d46f41ed7e5d1e0785f64e816","observation_id":"0c728253-c6ff-47dd-a180-3c67174b4682","resolution":{"observed_at":"2026-08-05T23:10:56.574765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.563091Z","title":"Hi-Fi Multi-Speaker English TTS Dataset,","venue":null,"work_id":"57c3b7c2-9a15-4c72-a25a-228d8a58bda2","year":2021},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.281453Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:6ec5e1647f70020db9333e372efdce0650b0c27f5afec82e6887763fc9507918","observation_id":"3dd725f1-d2eb-469c-a2ba-3e2c21c24f34","resolution":{"observed_at":"2026-08-05T23:10:56.565836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.555005Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":"09b0abea-8242-4473-9adf-234d07116fb2","year":2020},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.283718Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:dd90b745b4d4ee3b2b610623934904154997c4ee3bb000d2fd828130a248d8d1","observation_id":"5ee77d5e-84ef-498c-86ad-35a7632a363d","resolution":{"observed_at":"2026-08-05T23:10:56.557346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.548206Z","title":"Efficient sequence transduction by jointly predicting tokens and durations,","venue":null,"work_id":"5aecaba4-6923-4343-98b8-0d35bf142796","year":2023},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.285766Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:570bebb3e1744b3e3ee51319318a903bdb3b6202d55799ee73c5f23c9dc6e5ec","observation_id":"68de79d5-32d1-43a4-9482-35954a840aba","resolution":{"observed_at":"2026-08-05T23:10:56.550562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:10:56.539998Z","title":"Titanet: Neural model for speaker representation with 1d depth-wise separable convo- lutions and global context,","venue":null,"work_id":"9b67a80e-768c-481e-93dd-cf63256cfec9","year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.287904Z"},"links":{"citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:bbd5ecb7b649efefeb1b04fb7e8e81070d80f59a95e3e6361f46745091773f6a","observation_id":"a634319a-4e6c-45dd-bc1b-94800e445918","resolution":{"observed_at":"2026-08-05T23:10:56.542874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T05:08:26.914603Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2508.05835."}