{"as_of":"2026-08-17T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9469ec3ea88e39355d26e18ca6e478ac767ff2a8c3ae8d4a1ac6ea4a64cf7bbf","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:18.545560Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:13.833228Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:10:18.923633Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"cited_work":{"arxiv_id":"2505.22515","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22515","snapshot_observed_at":"2026-08-07T13:10:18.923633Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","venue":"cs.SD","work_id":"239ed175-980c-43e5-89c4-033434b92817","year":2025},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.833228Z"},"links":{"cited_paper":"/paper/2505.22515","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:60b0834ca96213e7a52b94d405e9eaeb96cd60882039f6cefe351c20c5bd2bf6","observation_id":"3214d133-e3d0-4e42-8505-cae52e5aaf1f","resolution":{"observed_at":"2026-08-07T13:10:19.104296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22515/citation-record","integrity":"/paper/2505.22515/integrity","json":"/paper/2505.22515/citation-record.json","paper":"/paper/2505.22515"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"cited_work":{"arxiv_id":"2505.22515","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22515","snapshot_observed_at":"2026-08-07T13:10:18.923633Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","venue":"cs.SD","work_id":"239ed175-980c-43e5-89c4-033434b92817","year":2025},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.833228Z"},"links":{"cited_paper":"/paper/2505.22515","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:60b0834ca96213e7a52b94d405e9eaeb96cd60882039f6cefe351c20c5bd2bf6","observation_id":"3214d133-e3d0-4e42-8505-cae52e5aaf1f","resolution":{"observed_at":"2026-08-07T13:10:19.104296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.878212Z","title":"We then practically decom- pose it into two key capabilities: robust reconstruction quality and consistency on downstream signal processing tasks","venue":null,"work_id":"e24b7d58-192c-4a0e-94ba-ffd28b61c6db","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:13.931770Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:85b0690cd97753725ee093bfe1355719bbaafb8081adbaa5b6759a7a051f5702","observation_id":"c4af061c-cb27-4952-a3b7-8ea52ba3e3a4","resolution":{"observed_at":"2026-08-07T13:10:26.038387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.563596Z","title":"Using this benchmark, several mainstream codecs are evaluated","venue":null,"work_id":"0be7ece6-2e9d-489e-b1ef-3d3fa7c55502","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.074398Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:ba9e392ebbe164e33a7aa17cfd175b139abee54372ddf6841f46b262cec47b0f","observation_id":"bd4d2e1f-f7a4-447d-974d-64864ac2da96","resolution":{"observed_at":"2026-08-07T13:10:25.726165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:25.269074Z","title":"While a few codecs have comparatively better reconstruction quality, such as DAC [5], they still lack down- stream task consistency","venue":null,"work_id":"029c6d46-e38f-4b9c-9f6b-237d12f19b58","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.243697Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:c1806f3d4dfe88a83c4631024c185d7a0d7b142905fd2609a556b3085d23fbad","observation_id":"6e1861d2-2f70-423b-a3b9-53b9e5fd5afb","resolution":{"observed_at":"2026-08-07T13:10:25.422742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.982992Z","title":null,"venue":null,"work_id":"92b9501a-97cb-4376-bfd1-fdbe7890ae36","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.377895Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:926169965b312d5cfd889e4030138851c4f073920ffca52981e16a749be6b5c9","observation_id":"4aa1e32d-57dc-40a1-95a5-bb1baca815b4","resolution":{"observed_at":"2026-08-07T13:10:25.146899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.718376Z","title":"w/o codec recon","venue":null,"work_id":"b7bfd79d-8387-4061-aff8-8251a04100a5","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.539953Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:8a9ce94c9f0ea2f0d3c9c30e5b511464e49ab66c0c61c4cad52076e5d3cbe9eb","observation_id":"28b0e6cd-22cb-4bbf-8c43-46c99221fd8c","resolution":{"observed_at":"2026-08-07T13:10:24.848045Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.475916Z","title":"Our experiments show that none of the tested codecs perform well in both aspects","venue":null,"work_id":"f35f4364-6058-4a6d-9b37-3c8f73e592b5","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.687859Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:b3aaa1a1d63923a4e1809408413a00d794bd378d624141fa8809f4eb39bb9abd","observation_id":"0ec85e33-c5aa-4c9e-8629-e851447a191d","resolution":{"observed_at":"2026-08-07T13:10:24.597140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.176768Z","title":"92370206), the Shanghai Municipal Science and Technol- ogy Major Project (2021SHZDZX0102) and the Key Re- search and Development Program of Jiangsu Province, China (No.BE2022059)","venue":null,"work_id":"a7d97e0a-8d39-4e1d-9bba-7c39b4d466b4","year":null},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:14.886698Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:04fbd2aaea767eba9f0e63275becae19df44010625c855a3c01254c8c4a67e4d","observation_id":"8936a41c-1560-4729-a944-0b88ad0ed044","resolution":{"observed_at":"2026-08-07T13:10:24.354513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.804487Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":"5048def2-ad2f-4e38-bb8f-4a7096c837a3","year":2025},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.037875Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:fd0c6a976b40216c13e5cd69a7896ee1c9eff380b3052b7e5b32ffa4878e387c","observation_id":"4c48144c-07ad-4700-99f7-4e07e8374713","resolution":{"observed_at":"2026-08-07T13:10:23.998348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.331243Z","title":"VioLA: Conditional Lan- guage Models for Speech Recognition, Synthesis, and Transla- tion,","venue":null,"work_id":"b1b7c8fe-3aa1-4197-92d9-daef56962468","year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.203567Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:4a4ab274562b815955f6b63b2491b8a91f90e1b32e2339057029dbf5514b17bf","observation_id":"5adb3320-db19-47ba-9466-af420e4bcf97","resolution":{"observed_at":"2026-08-07T13:10:23.506954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.011455Z","title":"GenSE: Generative speech enhancement via language models using hier- archical modeling,","venue":null,"work_id":"fa5a1d15-58de-446f-bb28-0e975001819b","year":2025},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.404592Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:aa591bb477fbad4b3cd541db547873d12045e7634893f1d26c5a4941229fe2f3","observation_id":"2af725de-8077-4e40-95a5-8c5836f1d9b2","resolution":{"observed_at":"2026-08-07T13:10:23.188475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.767710Z","title":"High Fidelity Neu- ral Audio Compression,","venue":null,"work_id":"cba37dab-5fdd-4fac-9af7-e0e4cbb6b0f1","year":2023},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.613816Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:34d7583979b316c93b66b95db415eb7ee6bc477d47ec66da283b1624ae0afe1f","observation_id":"0d1cc385-e16a-49d5-a4e5-f193666cfc8f","resolution":{"observed_at":"2026-08-07T13:10:22.889336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.582171Z","title":"High-Fidelity Audio Compression with Improved RVQGAN,","venue":null,"work_id":"2e8bcb0e-27f6-47a0-93d7-4eb4091e32be","year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.729027Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:3f8b8a3a7955e24b4a00db0ee2cd643f7999a0515bd507226fe63ea7883f77c8","observation_id":"5c5cc042-50c5-4b0f-b7ce-9ea8425ecd46","resolution":{"observed_at":"2026-08-07T13:10:22.659194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.360544Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Language Models,","venue":null,"work_id":"8d77acc3-e5cb-474c-816e-76c28eb29278","year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:15.885165Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:7b8474c64da7e910a702299790eca7a505d85f56f95935e15a3da01dd9026ef9","observation_id":"f570a2db-810d-4fca-8c42-1110c2784911","resolution":{"observed_at":"2026-08-07T13:10:22.492429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.019199Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound,","venue":null,"work_id":"ce2e4611-205f-4db1-b0bb-cc03e1b54230","year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.063793Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:d078a0e210ae99d69c1e06668b475dc0eb05e2fba5c629e0a84fc0df091398d4","observation_id":"ecd4377b-9c82-459b-bd6c-53d2c2809887","resolution":{"observed_at":"2026-08-07T13:10:22.203927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-08-16T20:33:30.347717Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-07T13:10:16.250961Z","title":"Codec Does Matter: Exploring the Se- mantic Shortcoming of Codec for Audio Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.250961Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:09d8eb14efa61fa3cd983eb4cd02e7e8a38dde3d7fa535c67e6106db0d46704d","observation_id":"4d8e903d-7815-4b5d-88b7-e66dcf891891","resolution":{"observed_at":"2026-08-07T13:10:16.250961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:16.373501Z","title":"Recent advances in discrete speech tokens: A review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.373501Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:72cdf8227cddc9fcda5fb3a88257997ad0ee0bd93f1ae14397fb51198bc904c8","observation_id":"caefb2d7-14b4-4978-ae73-df1d869aafec","resolution":{"observed_at":"2026-08-07T13:10:16.373501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.755603Z","title":"HuBERT: Self- Supervised Speech Representation Learning by Masked Predic- tion of Hidden Units,","venue":null,"work_id":"15bb04d4-16e0-4c38-b751-5779701409d6","year":2021},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.528999Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:cea9f1a07ad5f7ca933bb944260ca94564cf9bb696bd4cf90ffb1673da6260d9","observation_id":"950b4b5e-2fde-45a2-a7ee-fd29e7c2b0c7","resolution":{"observed_at":"2026-08-07T13:10:21.869382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T13:10:16.744389Z","title":"CosyV oice: A Scalable Multilin- gual Zero-Shot Text-to-Speech Synthesizer Based on Supervised Semantic Tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.744389Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:5c7fbef0fd9cefadd722f70937044b2aec3c1b4d51d771ed107d3ed391237881","observation_id":"7f60830f-debe-4ed1-b360-a5ed97ca6c50","resolution":{"observed_at":"2026-08-07T13:10:16.744389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13071","last_updated":"2024-09-18T12:02:47Z","snapshot_observed_at":"2026-08-16T14:16:55.230538Z","submitted_at":"2024-02-20T15:13:38Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13071","snapshot_observed_at":"2026-08-07T13:10:16.855230Z","title":"Codec- SUPERB: An in-depth analysis of sound codec models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:16.855230Z"},"links":{"cited_paper":"/paper/2402.13071","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:8111caa9a740c58844b2f0d1d50d7dd2ae7b2bfbabbe491596922c04a46b9e9d","observation_id":"3220e114-b8ea-4d27-bc95-11c8041ad9ef","resolution":{"observed_at":"2026-08-07T13:10:16.855230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-08-16T11:37:40.476254Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T13:10:17.038345Z","title":"DASB–Discrete Au- dio and Speech Benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.038345Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:9c51c7d40df9e9d53fc82c76db9d0d3dac4637c012d14fb3deea950a5d230f57","observation_id":"318945e0-f53b-43ab-9bf4-1a5c01d0b38a","resolution":{"observed_at":"2026-08-07T13:10:17.038345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.414434Z","title":"ICASSP 2023 deep noise suppression challenge,","venue":null,"work_id":"c5d6f9c4-bcd2-4ab5-b42c-1b074c40b169","year":2023},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.226356Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:f654114a226919bcfabb263ffea91167603f88e44dc3f5cb25c9cbf984965215","observation_id":"8ead3b84-04e7-4acc-b451-8fbf2e2ec5e8","resolution":{"observed_at":"2026-08-07T13:10:21.591563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.087597Z","title":"TorchAudio-Squim: Reference-less speech quality and intelligibility measures in torchaudio,","venue":null,"work_id":"37d2b28f-e41d-4ace-810b-c7815dd3985a","year":2023},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.431606Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:1cfbbbef955021961641e26419609ead051ad8a3159d7f96abc5368777e61403","observation_id":"6417ce1e-ee8c-47ae-9a5d-4a20b0e24dbe","resolution":{"observed_at":"2026-08-07T13:10:21.248913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.757061Z","title":"The PASCAL CHiME speech separation and recognition challenge,","venue":null,"work_id":"e84dc2b4-96cc-4152-906d-7e822ae415cb","year":2013},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.587626Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:d31b4252582cb1a2d877871e28b2bc8730b87d8bd76c5e7efd9e687bf1fe8bf4","observation_id":"5e2faa5e-e469-4c19-8f2e-cb2b29eedaad","resolution":{"observed_at":"2026-08-07T13:10:20.917315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.470389Z","title":"The INTERSPEECH 2020 deep noise suppression challenge: Datasets, subjective testing framework, and challenge results,","venue":null,"work_id":"60c87b11-3d9e-4f28-b74d-04302ccd103b","year":2020},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.719673Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:e552287384b519981634da92c102eca8317a0123d17bfca3672a75fa9397ee2c","observation_id":"d028e555-6523-4179-9060-1c7d7df16c04","resolution":{"observed_at":"2026-08-07T13:10:20.605173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.178208Z","title":"The 4th CHiME speech separation and recognition challenge,","venue":null,"work_id":"5d19b80a-96ca-4ac6-bc89-98a5c8b80547","year":2018},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:17.854885Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:42e08ac1c7d06d9197b1fd59df2841af47a717c1841b51bb48451d1cb4c2c770","observation_id":"67e13fb2-097b-4086-9aca-94cff3979ba9","resolution":{"observed_at":"2026-08-07T13:10:20.318390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.806703Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":"013ac9d5-8eeb-4349-ab51-97a3db3868f0","year":2023},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.009468Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:92f94b2b77d320f83125a508cd3802c6b6b3fb46253537de3704741286d7f2d2","observation_id":"4d04acfa-e957-4270-8e55-96c45377047c","resolution":{"observed_at":"2026-08-07T13:10:20.001058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.570990Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"8e3aca34-cef5-478a-a784-180551bd0e87","year":2021},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.193050Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:5c2046ac3118f6e37d15bfe5b0f0183e589e4b91e9c6d13b15c7f420cdd391e0","observation_id":"d4de15e6-1453-4126-99da-8fe1fe38ec91","resolution":{"observed_at":"2026-08-07T13:10:19.729246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.251198Z","title":"WHAM!: Extending speech separation to noisy environments,","venue":null,"work_id":"d34123d3-f409-4bbb-a032-bb51239c6c9a","year":2019},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.346916Z"},"links":{"citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:d93a0f69b738be140a373262708092869f6ed6c5821e2b32f50c6382e62500f3","observation_id":"4c2853f3-0088-4617-8002-3e3aef871dee","resolution":{"observed_at":"2026-08-07T13:10:19.409079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-11T15:07:28.270038Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-07T13:10:18.545560Z","title":"VERSA: A Versatile Eval- uation Toolkit for Speech, Audio, and Music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:18.545560Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2505.22515"},"observation_digest":"sha256:08f397db2eb682510db5e42f202698243b63932b0fe1037b9efba777ba0c40f8","observation_id":"c15c2178-688d-4af4-8e2d-1d99a5850cd5","resolution":{"observed_at":"2026-08-07T13:10:18.545560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22515","last_updated":"2025-05-28T16:03:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T17:30:18.820410Z","submitted_at":"2025-05-28T16:03:03Z","title":"Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.22515."}