{"as_of":"2026-08-17T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08247993aca9058faf7b14c919fb00e1d120c5ebdd9776095ddda1164919c6ec","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:11:55.394112Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T05:20:49.952030Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"cited_work":{"arxiv_id":"2507.18897","doi":"10.48550/arxiv.2507.18897","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InICASSP 2021-2021 IEEE International Conference on Acous- tics, Speech and Signal Processing (ICASSP), pages 606–610","venue":"ArXiv.org","work_id":"40938cf7-d6bd-47f1-a2cd-45e37adda59c","year":2025},"citing_paper":{"arxiv_id":"2604.14806","last_updated":"2026-04-16T09:30:13Z","snapshot_observed_at":"2026-08-01T04:51:16.142077Z","submitted_at":"2026-04-16T09:30:13Z","title":"Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T09:24:25.616750Z"},"links":{"cited_paper":"/paper/2507.18897","citing_paper":"/paper/2604.14806"},"observation_digest":"sha256:9e303e343064cc81d6804f19da88955835bda3a52bcf82a9d77c75e39dd105ec","observation_id":"ec4ecc8f-4c80-40da-9c5e-df10243578cd","resolution":{"observed_at":"2026-05-10T09:28:38.891667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"cited_work":{"arxiv_id":"2507.18897","doi":"10.48550/arxiv.2507.18897","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InICASSP 2021-2021 IEEE International Conference on Acous- tics, Speech and Signal Processing (ICASSP), pages 606–610","venue":"ArXiv.org","work_id":"40938cf7-d6bd-47f1-a2cd-45e37adda59c","year":2025},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-08-14T21:00:44.611035Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2507.18897","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:ebf2eea43287f09606b6beab91d9c0e04c9604c46406a635b6bcfbcb6a59dca6","observation_id":"4fd98e9a-bfcf-4e56-bc5f-8fea8212fb17","resolution":{"observed_at":"2026-06-28T05:21:39.776420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18897/citation-record","integrity":"/paper/2507.18897/integrity","json":"/paper/2507.18897/citation-record.json","paper":"/paper/2507.18897"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T18:11:55.297544Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.297544Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:a8962d274108b99d7f81302bf9b4ff646f6df54fcef0356f688f6c9034260b04","observation_id":"462a63bc-6a3d-4e3e-bf9d-c9d5f4b96dc3","resolution":{"observed_at":"2026-08-15T18:11:55.297544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:55.774590Z","title":"Overview of the evs codec architecture","venue":null,"work_id":"7c99f4fd-1865-4339-956b-76e88a182ba5","year":2015},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.327955Z"},"links":{"citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:413d85c88169b7bde144d95ff9743c5f66613ddba6dec3f6e50342de8423d3ac","observation_id":"23e1e775-e1b9-4f7d-a881-f28be003e22b","resolution":{"observed_at":"2026-08-15T18:11:55.778299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07402","last_updated":"2022-12-13T14:12:02Z","snapshot_observed_at":"2026-08-16T17:41:57.663501Z","submitted_at":"2021-11-14T18:16:42Z","title":"Textless Speech Emotion Conversion using Discrete and Decomposed Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07402","snapshot_observed_at":"2026-08-15T18:11:55.335336Z","title":"Textless speech emotion conversion using decom- posed and discrete representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.335336Z"},"links":{"cited_paper":"/paper/2111.07402","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:599a3a02ad00850414522e71dbaafffd86daff33fe21cfe5e95a375e15483aca","observation_id":"fe1a2dd0-d4b6-4767-882d-e715fcaf1d60","resolution":{"observed_at":"2026-08-15T18:11:55.335336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:55.762885Z","title":"Multi-scale sub- band constant-q transform discriminator for high-fidelity vocoder","venue":null,"work_id":"3520db09-ed3d-44ec-ab06-cb6b3aef7d59","year":2024},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.343115Z"},"links":{"citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:ea74d6de65916d33adac4aa10c79d0d292af5bb51bb30d751c2c2ea4ec9b10f5","observation_id":"20bdf8b8-6bc0-486e-8ee6-fbf87c9fa810","resolution":{"observed_at":"2026-08-15T18:11:55.766887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:55.346729Z","title":"Emilia: An extensive, multi- lingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.346729Z"},"links":{"citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:57212047c75896f88f33a4e029b2602e6a167c65547ac6744002c7b3f9e2bdec","observation_id":"aea01c95-f0f8-475a-b9e9-fd2a39d1bcb2","resolution":{"observed_at":"2026-08-15T18:11:55.346729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-15T18:11:55.350325Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.350325Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:35bc461d48e9c11a3a2858cb83836042f765006827346271b5e3cb72f2971916","observation_id":"69485992-1638-4842-b044-579ad86e708e","resolution":{"observed_at":"2026-08-15T18:11:55.350325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-16T16:54:06.083594Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-15T18:11:55.353862Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.353862Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:b373715f1d93e73e65766bb74b9f866d895ec0a821b4876665dcb30b050d9cfd","observation_id":"bb1a8488-8f32-4b5f-9aca-b31bc52845b5","resolution":{"observed_at":"2026-08-15T18:11:55.353862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-16T13:44:06.224559Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-15T18:11:55.357367Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.357367Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:c172834de50d346c44e899169f2ed2478fdf5650c7e7720d0abc862768139377","observation_id":"edbdc2fb-8313-446b-aea5-3ed0bb6e2846","resolution":{"observed_at":"2026-08-15T18:11:55.357367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-15T18:11:55.360754Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.360754Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:890257ac6fd37ff0d569dda44bb098b041bfbf92ae22b70ca1b85dd499051fa7","observation_id":"48a87d0d-3442-44be-9bd9-331e8abd7710","resolution":{"observed_at":"2026-08-15T18:11:55.360754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02967","last_updated":"2022-09-13T17:00:55Z","snapshot_observed_at":"2026-08-16T17:08:48.467808Z","submitted_at":"2022-04-06T17:59:22Z","title":"Enhanced Direct Speech-to-Speech Translation Using Self-supervised Pre-training and Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02967","snapshot_observed_at":"2026-08-15T18:11:55.364167Z","title":"Enhanced direct speech-to- speech translation using self-supervised pre-training and data augmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.364167Z"},"links":{"cited_paper":"/paper/2204.02967","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:d6b9132605635b8a65afa963a39722852174249c2e92b3f246952c28fce7664b","observation_id":"37aa6348-e795-4132-9b4d-342faa23e802","resolution":{"observed_at":"2026-08-15T18:11:55.364167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-16T17:09:10.917820Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-15T18:11:55.367705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.367705Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:59f3e8c316d16068e15a40b26ff9bc22595f9f462585f8e157e1368d9d8170c5","observation_id":"9779287d-7d2f-4980-a85e-2d13418a2679","resolution":{"observed_at":"2026-08-15T18:11:55.367705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-17T07:28:37.146698Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-15T18:11:55.371713Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.371713Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:8c604fffe667e3e683bffc23503fce66dac4ba860cc9d924f1defc02f72497b5","observation_id":"cc83373a-0ebe-4efa-9419-006e75ff1fbc","resolution":{"observed_at":"2026-08-15T18:11:55.371713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-16T15:27:27.142221Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-15T18:11:55.375110Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.375110Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:a0b0377788e9fa1aa27fc288064092fab195f10367912de044011910d0cf7bd5","observation_id":"9eb0fb14-fa1f-4604-a4f8-8687aee6342d","resolution":{"observed_at":"2026-08-15T18:11:55.375110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:55.742998Z","title":"H., Hendriks, R","venue":null,"work_id":"828d4bbd-eda5-4b77-aa17-1faa2d70e508","year":2010},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.378902Z"},"links":{"citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:43cac400ae6a86c070a8bd5862c72597e358698aa3c1c0abf322e04f5b01aff0","observation_id":"410dfe13-3645-4307-afc3-b8fc8a6f6117","resolution":{"observed_at":"2026-08-15T18:11:55.746789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-15T16:44:02.859541Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-15T18:11:55.389989Z","title":"J., Jia, Y ., Chen, Z., and Wu, Y","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.389989Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:a9eb2302a9d27707737535a4a2d7cea7615fff9f844a7595674cf7eecd45062e","observation_id":"bfaf7900-0d04-4e9e-a88a-0bfc24356ab2","resolution":{"observed_at":"2026-08-15T18:11:55.389989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:11:55.394112Z","title":"Addressing representa- tion collapse in vector quantized models with one linear layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.394112Z"},"links":{"citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:f8d2c77630fa7a61fa6be1721355272c040041daefc1af48839d7800c831a3a3","observation_id":"ecaa0243-654e-4c06-8a15-9b880b43ace4","resolution":{"observed_at":"2026-08-15T18:11:55.394112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.02095","last_updated":"2020-10-01T17:26:35Z","snapshot_observed_at":"2026-08-13T21:41:05.228578Z","submitted_at":"2020-09-04T10:22:43Z","title":"SEANet: A Multi-modal Speech Enhancement Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.02095","snapshot_observed_at":"2026-08-15T18:11:55.382457Z","title":"Seanet: A multi-modal speech enhancement network","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.382457Z"},"links":{"cited_paper":"/paper/2009.02095","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:a2f539d4329c1d6f38692e01077c566d94de476de868ef2441dfadb79cb8f381","observation_id":"8d92e18f-e846-483e-bbbd-016068783d3e","resolution":{"observed_at":"2026-08-15T18:11:55.382457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T18:11:55.331365Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.331365Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:0d4086a87fd9ce82cef0bbd339c36d2be8bc496d3a8b6442ad295254e7d0f42c","observation_id":"e3cd9dc7-a8cc-4d21-84b1-b77f000f398c","resolution":{"observed_at":"2026-08-15T18:11:55.331365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T18:11:55.386364Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.386364Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:dbf042f31310f5d8f1710bfec3dba1a5ca067c38b75ef644437bbe7c577f552e","observation_id":"9f8e55ff-669e-4306-99a9-5fc2d3ffc1f0","resolution":{"observed_at":"2026-08-15T18:11:55.386364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12611","last_updated":"2018-11-30T04:43:20Z","snapshot_observed_at":"2026-08-17T01:53:40.249016Z","submitted_at":"2018-11-30T04:43:20Z","title":"Virtual Class Enhanced Discriminative Embedding Learning","version":1},"cited_work":{"arxiv_id":"1811.12611","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.12611","snapshot_observed_at":"2026-08-15T18:11:55.691678Z","title":"Virtual Class Enhanced Discriminative Embedding Learning","venue":"cs.CV","work_id":"d4031925-b4a8-4676-8609-9b7438684b5e","year":2018},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.315040Z"},"links":{"cited_paper":"/paper/1811.12611","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:6bb31209b9b3cd661ae5cb685d4970ae827cd3c2c0db53237fc87ccd4893bcca","observation_id":"784dd7a5-97e1-4b6f-8cf6-d14127b47a93","resolution":{"observed_at":"2026-08-15T18:11:55.697983Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-15T18:11:55.306285Z","title":"Estimating or propagating gradients through stochastic neurons for con- ditional computation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.306285Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:a36593e65522b6fc3671dc63dad6d81abf1265f6ab2927b425c35176477ac7b1","observation_id":"623e8020-74cd-4149-ac46-cf8d4d9fafba","resolution":{"observed_at":"2026-08-15T18:11:55.306285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06424","last_updated":"2025-03-16T03:30:10Z","snapshot_observed_at":"2026-08-16T13:11:19.764516Z","submitted_at":"2024-10-08T23:39:34Z","title":"Restructuring Vector Quantization with the Rotation Trick","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06424","snapshot_observed_at":"2026-08-15T18:11:55.339064Z","title":"G., Duan, D., Iger, A., Liu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.339064Z"},"links":{"cited_paper":"/paper/2410.06424","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:544dcdd8feb224e8bac2fba40f312eddd87917cac879420d28fdf0520bdc2205","observation_id":"2d85cbd5-7560-4c54-8f46-8d607f89fb94","resolution":{"observed_at":"2026-08-15T18:11:55.339064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-15T18:11:55.323965Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.323965Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:cb96f40d7b3ddb7dc97a6e2a92813041d241837a807382597a87da548d966cd7","observation_id":"f94f1c66-4099-4ddc-a52c-ce56e9e9c916","resolution":{"observed_at":"2026-08-15T18:11:55.323965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T18:11:55.301847Z","title":"Seed- tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.301847Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:3891230ad174934a3b521aaa652f61f722bd19a03b72cadf0bb37935bebcbdd9","observation_id":"0a16ce14-c7d5-4a2c-bd3a-3876edc30654","resolution":{"observed_at":"2026-08-15T18:11:55.301847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-15T18:11:55.318713Z","title":"D´efossez, A., Copet, J., Synnaeve, G., and Adi, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T18:11:55.318713Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2507.18897"},"observation_digest":"sha256:ef30c02d209ad264bf36279034116124a84eea8fbe4c970f4d971aae030cf3da","observation_id":"a54e8fc2-36dc-4a05-aa11-07d2d9aa33c8","resolution":{"observed_at":"2026-08-15T18:11:55.318713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.18897","last_updated":"2025-07-25T02:44:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T00:47:18.660035Z","submitted_at":"2025-07-25T02:44:30Z","title":"HH-Codec: High Compression High-fidelity Discrete Neural Codec for Spoken Language Modeling"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 2 inbound Pith citation observations for arXiv:2507.18897."}