{"as_of":"2026-08-20T20:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:141bac18a04093ae4053fb0e225ac14730b87539deb2360872377a3b71b0a265","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:38:53.020619Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.01390/citation-record","integrity":"/paper/2509.01390/integrity","json":"/paper/2509.01390/citation-record.json","paper":"/paper/2509.01390"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:47.828183Z","title":"Recent advances in discrete speech tokens: A review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:47.828183Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:7ea84a54c8c248ace714fb72447ae114bf8f052bdac80966c99c81ff370deb4f","observation_id":"93baea51-eabb-443c-a1f8-c8fd41080f34","resolution":{"observed_at":"2026-08-05T12:38:47.828183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:02.454799Z","title":"AudioLM: A language modeling approach to audio generation,","venue":null,"work_id":"fab0adf9-09e0-4c3d-9f75-1396353ad5a9","year":2023},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:47.909101Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:951c3789e4868ca11b644bc77ddfb735fd9ff7486e15bc49aa07cb1f404a8f72","observation_id":"934f922c-576f-4fde-b974-10e1d4ce21c0","resolution":{"observed_at":"2026-08-05T12:39:02.517200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:02.281690Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"68acd4c0-eae1-4cf2-81f7-fc6456ee1560","year":2021},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.042946Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:c1701c24655ec0442d7cbf28fff4d09c13ca059948f9dcf1055838fa9b5b6358","observation_id":"8ae8a0c6-3ec4-4566-96e5-2b1db67655e1","resolution":{"observed_at":"2026-08-05T12:39:02.370659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:02.069947Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"3eca0875-409d-4656-9391-f00be717fa87","year":2020},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.177945Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:949349e5d122bd94199e4f9e7fb9b69fe6d92303759a9f5acc15f7f0d38ccef1","observation_id":"4041a20d-4ac9-4f8f-ae5a-85649f2a78fa","resolution":{"observed_at":"2026-08-05T12:39:02.171848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:01.875787Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":"f6610225-c4bf-45d8-8529-3a1cf43c2639","year":2022},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.311866Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:433429f5d587d76162bfe6e504e759a521bfed188fd185c82cf0406a3a0687fc","observation_id":"e01eb8f2-e939-4c53-9374-878e0348a511","resolution":{"observed_at":"2026-08-05T12:39:01.935201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:01.670901Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"186c3eed-7862-4b84-b4d7-220856ac61d0","year":2023},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.440170Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:e407a54580a6838b86f388d320e85a31500d8f7e1afdac3cd9e1124790085b0e","observation_id":"e08cd198-1235-4e56-9f58-52781ed4e063","resolution":{"observed_at":"2026-08-05T12:39:01.756366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:01.516093Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"28b4f535-ca31-4889-adc9-03586b78b402","year":2021},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.588703Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:7ac6cf489c48513c1943b419204e239212f3594f3b1e1c0e45a7e2b1f3615360","observation_id":"b336e898-42ee-41ef-9849-36a9b196e317","resolution":{"observed_at":"2026-08-05T12:39:01.595402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:01.341237Z","title":"Codec-ASR: Training performant automatic speech recog- nition systems with discrete speech representations,","venue":null,"work_id":"1e153951-ec32-4e6d-be0a-b7f31a8f15f1","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.762505Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:e98decc651e4b2f50c17289329a58530e002eebfca822bc08baee83b2bc994d8","observation_id":"6abe5939-c9d4-4a97-a52e-9e3d251fc21b","resolution":{"observed_at":"2026-08-05T12:39:01.420753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:01.128288Z","title":"Towards audio codec-based speech separation,","venue":null,"work_id":"3debd275-f01a-4f35-95c7-48046f081576","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:48.860876Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:eb96a24b72cb8ed1f289d93d50c1d713d8e65bf628228a6025dc630960878f98","observation_id":"02475e94-70c9-4907-a723-94f8bcdd86c7","resolution":{"observed_at":"2026-08-05T12:39:01.197754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:00.973340Z","title":null,"venue":null,"work_id":"9db004d2-e4d5-406a-a1b1-4c1742181261","year":1949},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.026273Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:07c93bfc11931122cdbd82a7db11f924e93c7badaf68c5197680953b647a623a","observation_id":"d74b8f9a-d389-45ba-8b70-a16fa6da2d83","resolution":{"observed_at":"2026-08-05T12:39:01.013643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:00.737840Z","title":"Contribution `a la th ´eorie math ´ematique des jeux de communication,","venue":null,"work_id":"55904eba-51d5-4cc7-883b-07971cfa95c8","year":1953},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.145845Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:323d0a30796139c3e6e0b29affe0a43d8e9959de2cecb5fd684085e189defe45","observation_id":"5717121f-715b-4cde-9852-81b650c8ec14","resolution":{"observed_at":"2026-08-05T12:39:00.827923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:00.455396Z","title":"Zipf and heaps laws’ coefficients depend on language,","venue":null,"work_id":"afa2f576-e0f0-4386-b3d9-95fcb98c5c35","year":2001},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.254148Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:aea3284c539edecd673e1081898dcbdd81b6569b4a744d9f4faa4b1a55cb5f5d","observation_id":"97de58d4-fc4e-46c9-bb04-34b8094ed978","resolution":{"observed_at":"2026-08-05T12:39:00.573564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:39:00.178096Z","title":null,"venue":null,"work_id":"c10ab027-ff1b-48dc-a939-b400339be998","year":1978},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.383651Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:b74dfcd20ec6e38ecd8d4d31a09e237a28dae6d36cf39ad99a0438ce09d971e5","observation_id":"26cf2e01-c8b5-4837-b27f-4dcda48715f3","resolution":{"observed_at":"2026-08-05T12:39:00.275671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:59.929707Z","title":"Prediction and entropy of printed english,","venue":null,"work_id":"94d6a9cc-a7e8-4367-b94b-42f7539e997e","year":1951},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.521443Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:050f4320214766693492eb1da7d5b1e8b9833fc27eb7b0e3421b8bf9a151cb15","observation_id":"a43c189a-7ddd-4d0e-9bd0-ad128bb39e59","resolution":{"observed_at":"2026-08-05T12:39:00.052947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:59.661703Z","title":"Do learned speech symbols follow Zipf’s law?","venue":null,"work_id":"8b83532b-8432-4717-8432-b4724a6ebe3b","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.674501Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:58f91a47b8ecc66d7fad26599181ca9cf4e49dfa6d0380c38bbba1c9b237824a","observation_id":"119fe14c-9ba0-40f9-b636-6b6c3782062a","resolution":{"observed_at":"2026-08-05T12:38:59.797673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:59.370370Z","title":"Analysing discrete self supervised speech representation for spoken language modeling,","venue":null,"work_id":"fe253dae-6317-4ffc-bc09-9c05e490175b","year":2023},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.816031Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:d623c93007ec5655666176c9a2fa08a6ee2058ee51599ffe83f85a0e77a324b5","observation_id":"1db5e06f-3c0f-42dd-b57a-7d183491da1b","resolution":{"observed_at":"2026-08-05T12:38:59.498285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:59.104136Z","title":"Visual instruction tuning,","venue":null,"work_id":"9252d9a0-1e95-4958-a334-655075f8a4cc","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:49.946869Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:fae1d243b50ed0f9caa75a7a99a9d42496a86f8ae1000743269c0c479f73e4ab","observation_id":"848309ff-733b-4369-8b1d-9fc14b77dafe","resolution":{"observed_at":"2026-08-05T12:38:59.230169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:58.852392Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models,","venue":null,"work_id":"79bab8d7-150e-458f-bd2b-975fd039c036","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.077587Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:a9ef4a340c1f1374ccd16633c4399580a9568b28974b8de12c762d0a6bfa9a53","observation_id":"b350026a-8d36-4585-b917-5727179c2875","resolution":{"observed_at":"2026-08-05T12:38:58.994300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-16T15:35:40.710158Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-05T12:38:50.189716Z","title":"HiFi-Codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.189716Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:4c2f3d464585fd7c60458f6f276a59e70b4aa815761af03a4cf9f8dd42a3e3bf","observation_id":"83bbd839-6360-4737-9f50-a666710a8e05","resolution":{"observed_at":"2026-08-05T12:38:50.189716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:58.621567Z","title":"Audiodec: An open-source streaming high-fidelity neural audio codec,","venue":null,"work_id":"944235a3-b684-4c1b-9ae7-9252620f0dc2","year":2023},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.297714Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:064ec9dc693adc0a6b7516415aa725a6d3fa5792af32b1b188988caaed889389","observation_id":"b0f20c24-c3f5-4821-b8d1-124612a23702","resolution":{"observed_at":"2026-08-05T12:38:58.686538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:58.349281Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"8297ed86-723f-4106-9ebb-67230bc5f7a9","year":2023},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.436368Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:4cfad79492bc9ed653bf3a3800fadbded3c847dab83c49e1d0813f17e703f8ee","observation_id":"014c84d7-6bc9-4af3-9aed-ed25d3708bed","resolution":{"observed_at":"2026-08-05T12:38:58.446860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:58.079752Z","title":"FunCodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":"354b7669-af43-483b-89ab-ea6262c9c80c","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.549650Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:7c7b8668622dcbaf2ccb80110928ff13095edbecb47cd75d86411b1bb8bb4f18","observation_id":"c6a77f82-4694-478a-a2fd-eab02ad22672","resolution":{"observed_at":"2026-08-05T12:38:58.174018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-20T12:20:52.955680Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-05T12:38:50.683004Z","title":"Towards audio language modeling – an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.683004Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:d11d1e57338d47e16f3ee8f8142177e3e57853ffcbd246718c0203907fcc9180","observation_id":"b5f5294e-c570-4d40-a952-cbe42cef73c7","resolution":{"observed_at":"2026-08-05T12:38:50.683004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:57.828926Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"bacbbad9-3d10-449b-86ca-52a5bc34b0cf","year":2015},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:50.856666Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:84e1274be3d52122979a473bfe36213149e55175d30e898f3b1064a975e8d6c3","observation_id":"ecba2082-796e-476b-89d6-2d10ba68abf0","resolution":{"observed_at":"2026-08-05T12:38:57.909729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:57.573775Z","title":"LibriTTS: A corpus derived from LibriSpeech for text-to- speech,","venue":null,"work_id":"bf46eaef-f5cb-4c91-9354-16c7b10243b8","year":2019},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.005160Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:26299d58b0629ab454f0f250bc883c5b46e941f63c3cf1475f0169c855742caa","observation_id":"ea9969cc-f53f-4e21-89e6-78b90f985800","resolution":{"observed_at":"2026-08-05T12:38:57.687768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:57.295310Z","title":"CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":"dc84dd81-d2e9-4aca-a0c6-7f1e75335eca","year":2016},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.115579Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:c2006f8c84404db4ebc56bdaac7e24d1689adf0a16cb1e3f38f2c20b3036b3be","observation_id":"99c7cb9c-c73f-4b3e-8063-cc3fe451486f","resolution":{"observed_at":"2026-08-05T12:38:57.404261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:57.006991Z","title":"AISHELL-1: An open- source Mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"7dc05911-3b4a-464e-a6d3-fcfbb6f8b74b","year":2017},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.221201Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:b8368b91bb2aec809fe563d516b873d7f60b67a21b65083680762d41c2100ec2","observation_id":"28674d44-6a83-4179-98d2-cce604e3b1de","resolution":{"observed_at":"2026-08-05T12:38:57.117704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:56.738636Z","title":"Noisy speech database for training speech en- hancement algorithms and TTS models, 2016 [sound],","venue":null,"work_id":"579a9d49-7b56-4452-9e38-668dec96e092","year":2016},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.381848Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:7ccc3cdc471e9b040e448551cf4942d681e4d974afda65792e9415863f2203c2","observation_id":"9d462bdc-8415-4e33-838a-f6a9a5ee3629","resolution":{"observed_at":"2026-08-05T12:38:56.850439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:56.393598Z","title":"Common V oice: A massively-multilingual speech corpus,","venue":null,"work_id":"69744c78-5d84-49b8-bc00-054d30c71c83","year":2020},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.482544Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:a6be261e18d640811a387256c84e84b2d1d5c26d5de8e1049c5d261ccc2bf743","observation_id":"d7cebba2-3328-4d7b-9648-e2dc20a228ba","resolution":{"observed_at":"2026-08-05T12:38:56.538805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:56.051222Z","title":"ICASSP 2022 Deep Noise Suppression Challenge,","venue":null,"work_id":"669ce7d7-fc0a-41f8-9331-a1f161745f14","year":2022},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.620267Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:9c77249b24666dd0a3878094d4c3cc8bb16e8e3eb09e1e78790bda7b9267d1c3","observation_id":"63191ca4-7d48-4473-9421-2e27604922d3","resolution":{"observed_at":"2026-08-05T12:38:56.232479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:55.709410Z","title":"The MTG-Jamendo dataset for automatic music tagging,","venue":null,"work_id":"44604651-edcd-469f-8fcf-86a22a573051","year":2019},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.737011Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:38073a53d64964ed0a30b9a609d9882417863e1af9bb6d14c2e2d17a52f4e94c","observation_id":"59150aed-4f6e-4dbe-a787-70a490c9056e","resolution":{"observed_at":"2026-08-05T12:38:55.845731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:55.459180Z","title":"Audio Set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"60af769b-b982-4281-a5e3-f5b818be0c75","year":2017},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:51.884331Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:5bad46df83d7d292075b8ee2b9dbf5d6faf3d1aa42dd9ab11881ada511d75c7a","observation_id":"cc879031-91b2-4c20-9802-f18ee72f8715","resolution":{"observed_at":"2026-08-05T12:38:55.558834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:55.188313Z","title":"FSD50K: an open dataset of human-labeled sound events,","venue":null,"work_id":"0d828e1f-8a82-4125-b70e-666fd7f6fa8b","year":2021},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.063484Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:5b64f4261364c1e784b0f125f9da469314553d9b021f8306d1180e2827896914","observation_id":"8f9419ee-3157-4a2c-b060-4a8b66cae5ec","resolution":{"observed_at":"2026-08-05T12:38:55.300470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:54.931722Z","title":"Codec-SUPERB: An in- depth analysis of sound codec models,","venue":null,"work_id":"287ae1bc-576e-4026-8b68-be579ddc9f65","year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.216696Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:dfa85ee8b2c686c727e8f656cd0a03107d87a50e8676baf38a4b61b78d6aa94b","observation_id":"f885bf4c-6eff-4943-8211-0f80c53b5b77","resolution":{"observed_at":"2026-08-05T12:38:55.021498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:54.687465Z","title":"CSS10: A collection of single speaker speech datasets for 10 languages,","venue":null,"work_id":"43a68d4c-fac7-4a96-903f-a88dd4c68e9c","year":2019},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.357996Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:fea22ea759b765108f4263c111f2a504a8008ec0f52acb57f51acf8898f82123","observation_id":"ded0432f-c923-4083-b451-637319904d2d","resolution":{"observed_at":"2026-08-05T12:38:54.814437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05001","last_updated":"2024-11-07T18:59:28Z","snapshot_observed_at":"2026-08-16T13:01:59.492469Z","submitted_at":"2024-11-07T18:59:28Z","title":"Analyzing The Language of Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05001","snapshot_observed_at":"2026-08-05T12:38:52.462732Z","title":"Ana- lyzing the language of visual tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.462732Z"},"links":{"cited_paper":"/paper/2411.05001","citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:52617fc1fdb81595e033db8fb9bf743a4a3d9c51dd9fbf73d275c0c053a6eb39","observation_id":"88f84108-252b-4b4b-8e9a-0dffae482c91","resolution":{"observed_at":"2026-08-05T12:38:52.462732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:54.439423Z","title":"Power-law distri- butions in empirical data,","venue":null,"work_id":"77e1b9f2-6aaf-4704-9e5f-e526fd46bcba","year":2009},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.609253Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:3338eae1a6d3a6cfe64a56f72182458c8c92c734cc1214a65413d113aa60acd0","observation_id":"99ab490b-54ca-46ef-ab88-cce988fd5ed2","resolution":{"observed_at":"2026-08-05T12:38:54.561544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:54.125379Z","title":"The kolmogorov-smirnov test for goodness of fit,","venue":null,"work_id":"aea944e4-2fd6-4615-b495-9d912606516c","year":1951},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.783588Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:8f1434a2ed06fed45b41a6da1cebbad318eacb591eda2ea7dcef3c3c119a18bd","observation_id":"aaf97a77-9825-48db-94c1-746c43ab9c95","resolution":{"observed_at":"2026-08-05T12:38:54.296149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:53.790614Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"e64e4cfa-bc09-4fc6-bf88-44c537f2c78a","year":2022},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:52.933287Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:b3cfca227263095bc13a9dd517bafdf735c57b56fcacc3931c313a3b01cfd933","observation_id":"1276af3b-e34f-4ad7-b324-d1d518df74f5","resolution":{"observed_at":"2026-08-05T12:38:53.924829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:38:53.570369Z","title":"UTMOS: UTokyo-SaruLab System for V oiceMOS Chal- lenge 2022,","venue":null,"work_id":"8b8f21ea-eb56-4266-8802-e17569a4d4a0","year":2022},"citing_paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:38:53.020619Z"},"links":{"citing_paper":"/paper/2509.01390"},"observation_digest":"sha256:409e74aa8f350106ff27d77e152f6c778146c9b3c7016626a27912adfb3a6b9c","observation_id":"90c9db1e-b54e-4c9c-9555-5086580a57a6","resolution":{"observed_at":"2026-08-05T12:38:53.662252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01390","last_updated":"2025-09-01T11:36:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T11:39:44.665634Z","submitted_at":"2025-09-01T11:36:33Z","title":"Analysing the Language of Neural Audio Codecs"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2509.01390."}