{"as_of":"2026-08-12T15:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dd15e5395d442cb9559cae6eb3c897551a5dacd516aee332c20bea48aba930f","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:12:00.395703Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:11:56.263021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T22:12:00.605940Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"cited_work":{"arxiv_id":"2506.22362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.22362","snapshot_observed_at":"2026-08-06T22:12:00.605940Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","venue":"eess.AS","work_id":"9494d0cf-ac72-43b5-b700-f7b1a4475224","year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.263021Z"},"links":{"cited_paper":"/paper/2506.22362","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:754cb75afdd44fdee9ad19e671fd5ec7518848a38439247449fa2e6bdbe9d715","observation_id":"5b9800ea-3637-49ad-8f7e-0333b5d11c53","resolution":{"observed_at":"2026-08-06T22:12:00.657415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22362/citation-record","integrity":"/paper/2506.22362/integrity","json":"/paper/2506.22362/citation-record.json","paper":"/paper/2506.22362"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"cited_work":{"arxiv_id":"2506.22362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.22362","snapshot_observed_at":"2026-08-06T22:12:00.605940Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","venue":"eess.AS","work_id":"9494d0cf-ac72-43b5-b700-f7b1a4475224","year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.263021Z"},"links":{"cited_paper":"/paper/2506.22362","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:754cb75afdd44fdee9ad19e671fd5ec7518848a38439247449fa2e6bdbe9d715","observation_id":"5b9800ea-3637-49ad-8f7e-0333b5d11c53","resolution":{"observed_at":"2026-08-06T22:12:00.657415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.835178Z","title":null,"venue":null,"work_id":"bd5f7e83-7665-4dc3-a14d-8ea147c14048","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.378331Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:b493f471e199e02b363355e2325fc6fd3beb20eb3709cf96edd24c03e3befa4e","observation_id":"8df8c223-4cfd-4c6b-82d9-88e276c36f6b","resolution":{"observed_at":"2026-08-06T22:12:05.884534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.501529Z","title":"SS-SC and SS-CL are optimized with 1e−4 learn- ing rate for 1 million steps","venue":null,"work_id":"5b29705e-1c71-4607-8108-2c950607f960","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.883055Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:babb50843ede92bd69cdad52afde057419887c9988f20c6f53f18312157fdb8c","observation_id":"61ed7bf7-03e8-4cb2-92e4-ad7026f60aaf","resolution":{"observed_at":"2026-08-06T22:12:05.545419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.383016Z","title":"There are two major limitations: it only supports non- 2The 10 audio clips are sampled uniformly from LibriTTS test-clean omitting those less than 5s","venue":null,"work_id":"95a0ff5c-4529-4ccf-9001-1363d267dc99","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.068976Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:f27c00d060ef344360474bd022a29ff5737fe8c11c0fa11e9948c9ce3fa9e0f7","observation_id":"58d2b895-c15f-4d5c-979d-86e1565358a0","resolution":{"observed_at":"2026-08-06T22:12:05.432611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-06T22:11:57.819506Z","title":"High Fidelity Neural Audio Compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.819506Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:ef79b7f7edf71eda91c67cdf63b1713444a2d36159ce0bfe56b9db9aad50c298","observation_id":"697cd690-a421-48a1-b57a-f10af5163824","resolution":{"observed_at":"2026-08-06T22:11:57.819506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.706066Z","title":null,"venue":null,"work_id":"164373fd-1518-40bd-a18a-ba73f2ea4298","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.556586Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:48be8cad26ad2e7f0d5f35bc0681d51af1db9f406b6747f6ca997a5b31a312dc","observation_id":"470f8e5c-fd4b-44f3-a4ed-73491a7869a3","resolution":{"observed_at":"2026-08-06T22:12:05.785845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.270242Z","title":"HuBERT: Self-Supervised Speech Rep- resentation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"64829aee-a0e7-493e-996a-167f1e508091","year":2021},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.215975Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:84e62821596718004ad43e56746fca3e6a2b04b1e35a82784f5b12abfa725bfe","observation_id":"cb89ca61-b5f7-4f40-bbcf-3a46db86612f","resolution":{"observed_at":"2026-08-06T22:12:05.326298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.148899Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Represen- tations,","venue":null,"work_id":"b28c85fd-3226-4435-867f-cfcfb93c5be3","year":2020},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.401222Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:74fc8205aa915d2c9968bd230f8709341b91e73ece7c72401f9dfe90d9da6e66","observation_id":"7f71171f-daf1-4a7f-be44-40d65d974f96","resolution":{"observed_at":"2026-08-06T22:12:05.192372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:11:57.528724Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.528724Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:353977a5c7c6deba241b728c7070ab07ee5faa6d4bd07be475a484aebc080a93","observation_id":"d5a9493a-cb89-4734-9dbf-e5e0eeb6fddf","resolution":{"observed_at":"2026-08-06T22:11:57.528724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.028154Z","title":"w2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre- Training,","venue":null,"work_id":"3fae04b1-a7ba-44ec-903c-ed52a91887f2","year":2021},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.697694Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:96b46bcf90032d75bde3496de40a6ec71bf1fbf12a806af6691c53ea5bd73eeb","observation_id":"fd77f7af-be89-4f03-bdd7-70e59f5c7aab","resolution":{"observed_at":"2026-08-06T22:12:05.084487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.301334Z","title":"PolyV oice: Language Models for Speech to Speech Translation,","venue":null,"work_id":"f7bcef01-224e-4ba8-ae4a-cafe1ab7140a","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.332796Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:43586a15ba0f8dce4e627c6fb7c848c76a3c70f281f5b41c649a65cce52803b7","observation_id":"28cb9e28-d715-4793-8603-bff255369fec","resolution":{"observed_at":"2026-08-06T22:12:04.407814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.876474Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"b9bcd55a-bbb5-4a7c-9c94-e0dcedda3a1f","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.887238Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:43b5c23f7a6c6286d8f07cfd1cb12b14e33263f1882307d8f16a4de96044a770","observation_id":"2ae3cbb9-8dce-49cb-8963-43e3a5d44fe8","resolution":{"observed_at":"2026-08-06T22:12:04.950584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.652665Z","title":"AudioLM: A Language Modeling Approach to Audio Generation,","venue":null,"work_id":"62baf191-a79b-4fd5-8c79-388abe380f8e","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:57.968067Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:b36d58eb7ea95866b69f77626e9db5e2bf3fe111d9c844ae24700ee1dfad50ca","observation_id":"5616e741-3b16-4a35-b52a-46ffd11ba287","resolution":{"observed_at":"2026-08-06T22:12:04.753500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03540","last_updated":"2023-02-07T15:48:31Z","snapshot_observed_at":"2026-07-06T14:49:19.585577Z","submitted_at":"2023-02-07T15:48:31Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03540","snapshot_observed_at":"2026-08-06T22:11:58.039438Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.039438Z"},"links":{"cited_paper":"/paper/2302.03540","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:1eae4285914415362eda2d95369065863853bc714ab71afd0952110bb4a384ef","observation_id":"f371b50b-589e-4282-903e-299acaccadd5","resolution":{"observed_at":"2026-08-06T22:11:58.039438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T22:11:58.112443Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.112443Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:faa476d0461e4285348efa48020c610bba72dc30e7d2b1d33425df96ea68fdbf","observation_id":"f6314508-c797-4b3c-b0c6-6201c39e2af5","resolution":{"observed_at":"2026-08-06T22:11:58.112443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.514746Z","title":"TokenSplit: Using Discrete Speech Representations for Direct, Refined, and Transcript- Conditioned Speech Separation and Recognition,","venue":null,"work_id":"32638627-74c6-45bf-be94-e013d92ec2d0","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.204048Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:531f4b9f280d42e64f9ceb4a15847b425fa9cb44dcf39671cb07d79583918173","observation_id":"53225d5e-261b-47b4-b570-6f689c6a2011","resolution":{"observed_at":"2026-08-06T22:12:04.590748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.582418Z","title":"Denoising Diffusion Probabilistic Models,","venue":null,"work_id":"faa0443b-1127-4020-a0c3-2fab7a366324","year":2020},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.800630Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:6ca7540a6c0ba56b8e6dfeff23ddc72b7df74be0dfabc860b365748a1d61af04","observation_id":"741d6f2e-ded0-471f-8981-7d2a8d44a1cd","resolution":{"observed_at":"2026-08-06T22:12:03.658852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-11T08:04:13.200079Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03382","snapshot_observed_at":"2026-08-06T22:11:58.428052Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.428052Z"},"links":{"cited_paper":"/paper/2502.03382","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:476c6ae30401c94a58a5e0ee41b5fe35d5f84dd76615d2676d470a11093ba6fb","observation_id":"541cf954-a92b-44d0-ac2b-02138a4b836a","resolution":{"observed_at":"2026-08-06T22:11:58.428052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T22:11:58.489098Z","title":"Moshi: a speech- text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.489098Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:ffe6af4e1c99a8fb4398ee78034d32e3d3586b37717ac90521cc6172bcfdbfaf","observation_id":"346f092b-0acc-4437-bcc2-9fd0777a651b","resolution":{"observed_at":"2026-08-06T22:11:58.489098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:04.093202Z","title":"Autoregressive Image Generation Using Residual Quantization,","venue":null,"work_id":"d0ffdb07-39ab-41ea-b34e-50d37eb281a9","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.579941Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:9ce8313cebcf552e6bf31879b712aaa89637046051518d22652513a9d55cde8c","observation_id":"ba766575-ff7d-4c67-8a2f-1b753275e311","resolution":{"observed_at":"2026-08-06T22:12:04.193477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.918679Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"82b35aa6-9040-4851-bb01-11fa51a63f23","year":2020},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.652586Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:696f6179d4a3266999cc24a7bec91f1671c30dc5e79a8e6bf62568cc3d149052","observation_id":"0503de73-1854-4765-b019-aa31e7982554","resolution":{"observed_at":"2026-08-06T22:12:04.004761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.741242Z","title":"Mel- GAN: Generative Adversarial Networks for Conditional Wave- form Synthesis,","venue":null,"work_id":"8fddd4ec-57b1-440f-a5ba-5e1b74786a42","year":2019},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.731676Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:281ecaa00f72ee26547fd25ba3bf012c0dd5f21e48b42db5df2a0b89cfad85d3","observation_id":"2eee440f-7147-4fdf-b57b-56e8a377ca85","resolution":{"observed_at":"2026-08-06T22:12:03.825848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.665500Z","title":"Auto-Encoding Variational Bayes,","venue":null,"work_id":"c4478767-ad1b-4abc-8f98-a71d5ce121cb","year":2014},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.303877Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:12d3fa6a37ff1fbf85aa8bc2815d9773a02b5bad01f8701ee18a1cb8d7a757b7","observation_id":"b518cc89-7d79-492f-b39e-9406b9a98ced","resolution":{"observed_at":"2026-08-06T22:12:02.760597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.437356Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermody- namics,","venue":null,"work_id":"be143c1c-5262-4631-be9b-07ceb1737b60","year":2015},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.879689Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:8b426cec1a330875c72b83713aac17b7e8ff8fc07313b0b3348a20496b9555fa","observation_id":"29dbd204-1178-4dc2-aa33-9055e61bcc79","resolution":{"observed_at":"2026-08-06T22:12:03.492841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:05.596203Z","title":null,"venue":null,"work_id":"85f7fd00-d54a-4278-9407-ac4e43783d63","year":null},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:56.737595Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:335e78f43c2091491e9bdd0ff4bb288ada6864d1c7f349e9c66d187f7655706c","observation_id":"415f794e-88e2-4cbb-9868-005b8a65a511","resolution":{"observed_at":"2026-08-06T22:12:05.654095Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.261781Z","title":"Multi- step Distillation of Diffusion Models via Moment Matching,","venue":null,"work_id":"6819e1c3-5d9a-4aee-8450-55bf87bfac1a","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:58.962209Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:d16b1bc7f6c389133f74fb84f6fced68e294ff86e0b95587e8166a5855779566","observation_id":"75e26e44-6ab8-478a-9520-2502c3b003aa","resolution":{"observed_at":"2026-08-06T22:12:03.345517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:03.046093Z","title":"SpeechTok- enizer: Unified Speech Tokenizer for Speech Language Models,","venue":null,"work_id":"b9ebe94f-43df-42a3-b604-fa005be03fdd","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.044535Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:36bb77dc9351fa8b42e6d520bbb205c2c31f5799fabd7be7d623a326fb7aaaf1","observation_id":"09f42aa1-4ebc-4c2d-a76a-6ec7a3930a25","resolution":{"observed_at":"2026-08-06T22:12:03.154376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.846547Z","title":"Simple and Controllable Music Gen- eration,","venue":null,"work_id":"37952a16-2395-4c9e-aabc-44237abba6c1","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.138687Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:5ee0e66995bf0d82c415bab3b3588a899a46e834bcfbdfd1c514400d780d88be","observation_id":"1a30a0b0-92f1-4a23-8d32-43abdcd71bd9","resolution":{"observed_at":"2026-08-06T22:12:02.959308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-06T22:11:59.228454Z","title":"SoundStorm: Efficient Parallel Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.228454Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:b88096ada8e8f989169213da6753db7bc8ae93602d620b0c637cfe161eee8c03","observation_id":"d6b0c266-afa8-44f9-8036-d6e1b059ab5c","resolution":{"observed_at":"2026-08-06T22:11:59.228454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.480017Z","title":"FiLM: Visual Reasoning with a General Conditioning Layer,","venue":null,"work_id":"7d517a37-0ae8-47ea-afda-46d72ca6c507","year":2018},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.401405Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:d14391fed7c1205b9a21c1f7bb96da706917fed32735053002b6bb50007fa240","observation_id":"57ce0ac9-6869-4c4a-ad8d-8a7f7314c980","resolution":{"observed_at":"2026-08-06T22:12:02.583977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.290012Z","title":"High-Resolution Image Synthesis With Latent Diffusion Mod- els,","venue":null,"work_id":"5261622f-db6e-4d5c-8f7e-0df3cead9ea3","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.467113Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:7c462c0142ea410261bacdde2940975dbc75f7853bbde739612891455ed07a84","observation_id":"5ff8a0bc-abcd-4e0b-bcd1-eb5534083d2f","resolution":{"observed_at":"2026-08-06T22:12:02.376140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:02.118440Z","title":"Improved Denoising Diffusion Probabilistic Models,","venue":null,"work_id":"afaa5518-5570-4cf1-81b5-ad3a309d0a0e","year":2021},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.562721Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:7d1355d20207fafd8419418471252a0a40c2b50040847532c9f2440b02530348","observation_id":"77eab515-24e4-4ea3-b1e9-cd5e767fa542","resolution":{"observed_at":"2026-08-06T22:12:02.220833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.934975Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models,","venue":null,"work_id":"fd60b995-b21b-4b1a-a51d-ca78dab177b6","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.627762Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:9e3c606a8f4d7f5b0cd7c85b62210d1ac57c7782e6b66ccdaebd0554b5209bae","observation_id":"67e37efe-fc40-4e9b-992e-6b321fc40388","resolution":{"observed_at":"2026-08-06T22:12:02.030022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.724883Z","title":"Understanding Diffusion Objectives as the ELBO with Simple Data Augmentation,","venue":null,"work_id":"d0f3776a-d949-495a-8799-18568ea9a9b3","year":2023},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.723665Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:55e6123bc3aeaf3f3941e7c35a45fb8c6a5934e5c1636cc4506e3635e26b0d8c","observation_id":"43f4d6bd-f5e9-4c83-a00c-da998cabf0cc","resolution":{"observed_at":"2026-08-06T22:12:01.835199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T22:11:59.809510Z","title":"WaveNet: A Generative Model for Raw Audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.809510Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:8c0a5f3bbe7e40832104c59f645a8b88a4c164827e74276e02e1de60553cdfe0","observation_id":"98e74125-b74a-4b75-8179-05ebc6103f4f","resolution":{"observed_at":"2026-08-06T22:11:59.809510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.553377Z","title":"Improved Distribution Matching Distillation for Fast Image Synthesis,","venue":null,"work_id":"3ddd91bd-eddc-4651-9751-c58879b02f79","year":2024},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.912833Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:7084b81f5aa5766827c802b5f6c6a795e4dfa8b73a286910dbe68340adf66114","observation_id":"ee08011d-db9e-4b47-af8a-a1ced36515b6","resolution":{"observed_at":"2026-08-06T22:12:01.628591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.352639Z","title":"Adam: A Method for Stochastic Opti- mization,","venue":null,"work_id":"d50755db-fa75-4f2f-a204-a267a47cab13","year":2015},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:11:59.998448Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:783865e263b8499276d9f1a9c3955f05a627c1077075efeae3501971c9cfaa39","observation_id":"98d1f1e6-947e-45f9-8bd9-2e14b9a64f87","resolution":{"observed_at":"2026-08-06T22:12:01.443509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:01.097994Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech,","venue":null,"work_id":"14cf9a45-13ac-45ff-b09c-2776eecb4c87","year":2019},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.112002Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:6586008103b3b434ddd94cc1a42c9b5270d60bc312432433f96c1cd948c7698b","observation_id":"660927e8-3baa-4905-bf20-2df453f72676","resolution":{"observed_at":"2026-08-06T22:12:01.166687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:00.940173Z","title":"DNSMOS P.835: A Non-Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors,","venue":null,"work_id":"fcacd06e-ae82-42cf-8005-574b56933b88","year":2022},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.221210Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:6713357364d9e0400ab5a2f41fb914fc6beaa94f4b2061ea67d6d4fc7f39f95f","observation_id":"bc7abb8f-32a5-404e-a102-33693344d727","resolution":{"observed_at":"2026-08-06T22:12:01.013883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:00.758110Z","title":"Method for the subjective assessment of intermediate quality level of audio systems,","venue":null,"work_id":"887b9f9f-27cf-4831-8ddd-953e84b73d64","year":2014},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.325633Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:83b29035df18425dd9da5659ed5fa03e528b0da5433a6d7bcf05fe8ce29bec17","observation_id":"941ab650-d1d2-4991-8545-9bba2435104b","resolution":{"observed_at":"2026-08-06T22:12:00.848285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:12:00.395703Z","title":"From Slow Bidirectional to Fast Autoregressive Video Diffusion Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:12:00.395703Z"},"links":{"citing_paper":"/paper/2506.22362"},"observation_digest":"sha256:3d5dd88c2f31ccaed0a60c102be3b962699c42802636946914026a72cb274f08","observation_id":"5ef30e46-e58e-47f3-97e6-20c11c41a23b","resolution":{"observed_at":"2026-08-06T22:12:00.395703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22362","last_updated":"2025-06-27T16:23:07Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T03:41:10.634171Z","submitted_at":"2025-06-27T16:23:07Z","title":"DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.22362."}