{"as_of":"2026-08-14T11:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d5a46933284e19d30dec914cd41448443ef7e69f6cdc09d407962828644cfb7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:37:03.781195Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:20:49.180965Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T13:12:18.207183Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":"2502.02942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenSE: Generative speech enhancement via language models using hierarchical modeling","venue":null,"work_id":"a11cdfee-3f54-48ba-828c-7ab4fb9aab7d","year":2025},"citing_paper":{"arxiv_id":"2505.24437","last_updated":"2026-05-07T16:01:45Z","snapshot_observed_at":"2026-08-11T08:48:59.548957Z","submitted_at":"2025-05-30T10:20:04Z","title":"SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T13:10:14.839742Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2505.24437"},"observation_digest":"sha256:731e367d9e308d93c962c416da750362db1ae575e2aa035fd5718e5aea35f21d","observation_id":"0934fbbf-1b5d-4e48-a3c9-4affd5419835","resolution":{"observed_at":"2026-05-19T13:12:18.210108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-08-03T14:20:49.180965Z","title":"Gense: Generative speech enhancement via language models using hier- archical modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-09T23:24:19.443679Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.180965Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:eb72c8af78fb35b2f6da804b761159109685bc13c76859a8917b29d5ae5efca9","observation_id":"9fd7e768-dd26-4c45-b1b6-e75b77c43489","resolution":{"observed_at":"2026-08-03T14:20:49.180965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":"2502.02942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GenSE: Generative speech enhancement via language models using hierarchical modeling","venue":null,"work_id":"a11cdfee-3f54-48ba-828c-7ab4fb9aab7d","year":2025},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-12T23:58:03.604754Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T10:18:16.972414Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:906d8b03c235460618f5cf56c588bb2342f7a2c3aef61399e8025ebe17990d31","observation_id":"32b38a54-4b1a-46c1-afd9-a606c2a2009d","resolution":{"observed_at":"2026-05-10T10:19:19.986900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02942","snapshot_observed_at":"2026-08-02T16:16:37.017642Z","title":"GenSE: Generative speech enhancement via language models using hierarchical modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14606","last_updated":"2026-07-20T08:55:18Z","snapshot_observed_at":"2026-08-12T23:58:03.604754Z","submitted_at":"2026-04-16T04:25:03Z","title":"UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T16:16:37.017642Z"},"links":{"cited_paper":"/paper/2502.02942","citing_paper":"/paper/2604.14606"},"observation_digest":"sha256:8372b6e990bb4f4bb63b0b4bb296c05b6958ec5db9090a723d33d5b5dfd1840b","observation_id":"0edcb4b6-3f4a-40e9-b27e-001503530b53","resolution":{"observed_at":"2026-08-02T16:16:37.017642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02942/citation-record","integrity":"/paper/2502.02942/integrity","json":"/paper/2502.02942/citation-record.json","paper":"/paper/2502.02942"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10533","last_updated":"2024-09-24T01:14:07Z","snapshot_observed_at":"2026-08-13T04:17:45.090636Z","submitted_at":"2024-02-16T09:38:16Z","title":"APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10533","snapshot_observed_at":"2026-08-09T10:37:03.556157Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.556157Z"},"links":{"cited_paper":"/paper/2402.10533","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:e17e93579a6d2330e32da5031f9bfee003d696c96e8d16dc29778d8f5a6afa41","observation_id":"06c49604-3c9a-4dd1-8f00-73114a9b30ea","resolution":{"observed_at":"2026-08-09T10:37:03.556157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.284434Z","title":null,"venue":null,"work_id":"caee46df-214e-42f3-b95b-37a30e2aceb4","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.771761Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:6c41bd1e92a4d06f40461ab68d03008473def004f0435987ea24a66e2bbee9dc","observation_id":"5f9c9a7a-a4bb-4285-bb43-bec73dc56985","resolution":{"observed_at":"2026-08-09T10:37:04.289191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13979","last_updated":"2020-12-15T23:19:19Z","snapshot_observed_at":"2026-08-13T17:50:33.934751Z","submitted_at":"2020-06-24T18:25:05Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13979","snapshot_observed_at":"2026-08-09T10:37:03.570902Z","title":"Unsupervised cross-lingual representation learning for speech recognition","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.570902Z"},"links":{"cited_paper":"/paper/2006.13979","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:af6cf7713403b8d7078063a26bb1a58413691966b206aeb10b00219348c242b3","observation_id":"31249799-37a2-4892-b4d0-c234593b4b53","resolution":{"observed_at":"2026-08-09T10:37:03.570902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-09T10:37:03.575758Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.575758Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:987d58033965aad0f747352f03b3812130dadf71e1c7f8e57991514e54469f7e","observation_id":"fbe90fbe-7b1b-4277-9412-1d6f0bcfd610","resolution":{"observed_at":"2026-08-09T10:37:03.575758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02982","last_updated":"2023-06-13T15:15:17Z","snapshot_observed_at":"2026-08-13T11:24:11.241517Z","submitted_at":"2023-06-05T15:53:15Z","title":"PolyVoice: Language Models for Speech to Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02982","snapshot_observed_at":"2026-08-09T10:37:03.580194Z","title":"Polyvoice: Language models for speech to speech transla- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.580194Z"},"links":{"cited_paper":"/paper/2306.02982","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:09042275edd9b14f8f2892ca8385f3aa1db3d4feb2f30c6c5d342b0e4edc1228","observation_id":"92ae16bd-9663-40d1-8f3b-627c34399576","resolution":{"observed_at":"2026-08-09T10:37:03.580194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.253296Z","title":null,"venue":null,"work_id":"454e6948-d831-4bca-a311-9979d1037f4f","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.781195Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:ba4e089de92feab925107d258fc8d49dc9be38951c8a6c5c9a2dbf8ba7da75b6","observation_id":"e841061e-bef3-4a40-b3aa-58a2eca8e5f3","resolution":{"observed_at":"2026-08-09T10:37:04.257698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.542674Z","title":"Variational autoencoder for speech enhancement with a noise-aware encoder","venue":null,"work_id":"76ada0b8-cb54-4191-8bae-e337472f409c","year":2021},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.590284Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:80e371ca76f396285766cf54494fadaca923ccfab691f67b140fbb18d30655c1","observation_id":"48a5a75d-e41e-476f-9180-c9c63600d22c","resolution":{"observed_at":"2026-08-09T10:37:04.547934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.513271Z","title":"Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement","venue":null,"work_id":"dc08de33-baab-4d28-9348-f161280f2a79","year":2021},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.605648Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:f928ae9fa89f6d61cb5b0f138ed234c19149a80032d5be02dd2f0e0084480e01","observation_id":"12139086-bc1d-4c2b-a568-7ebed5a690f8","resolution":{"observed_at":"2026-08-09T10:37:04.517963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.498075Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"ff61af0e-1b16-41f8-8cf6-f007e51da71a","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.610815Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:04177a72c5e550d0fc9cf773119a49b2bf363451a4a40e44fffc2ca40adb2ec2","observation_id":"f2468bc9-e5a0-4d90-89f6-93ce67188133","resolution":{"observed_at":"2026-08-09T10:37:04.502747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11377","last_updated":"2022-12-21T21:36:52Z","snapshot_observed_at":"2026-08-13T13:16:55.340729Z","submitted_at":"2022-12-21T21:36:52Z","title":"ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2212.11377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.11377","snapshot_observed_at":"2026-08-09T10:37:04.139609Z","title":"ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement","venue":"eess.AS","work_id":"10b7cba0-4e2c-4955-a2c4-f8b9521096b2","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.615473Z"},"links":{"cited_paper":"/paper/2212.11377","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:631490af95bd7c9eabe10f36e4040907db9d77ef303b8c1273fc6900f6c6875e","observation_id":"9e98d6b6-d2a6-4112-9438-43f1561609be","resolution":{"observed_at":"2026-08-09T10:37:04.145349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12208","last_updated":"2025-06-04T05:50:15Z","snapshot_observed_at":"2026-08-13T04:15:21.068786Z","submitted_at":"2024-02-19T15:12:12Z","title":"Language-Codec: Bridging Discrete Codec Representations and Speech Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12208","snapshot_observed_at":"2026-08-09T10:37:03.620875Z","title":"Language-codec: Reducing the gaps between discrete codec representation and speech language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.620875Z"},"links":{"cited_paper":"/paper/2402.12208","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:1884e975d718f9620dc3c9ab690e7bbb04039e09f3db33bfce20b1ea8b560593","observation_id":"d5073d6b-362b-4ea3-9cd6-5d5a8f4957a7","resolution":{"observed_at":"2026-08-09T10:37:03.620875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.483950Z","title":"Libri- light: A benchmark for asr with limited or no supervision","venue":null,"work_id":"5c55df62-2617-44f2-b40e-7af34e6929a0","year":2020},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.630522Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:6cb4d6ba5ae1cd45ee7ce7415eaad2b27674a6f362f217e644fc38d017ee55ce","observation_id":"69673469-7183-4116-9255-789da0f976fc","resolution":{"observed_at":"2026-08-09T10:37:04.488624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.469159Z","title":"A study on data augmentation of reverberant speech for robust speech recognition","venue":null,"work_id":"f2636566-48d8-4a5e-80ec-fe96ac3512cc","year":2017},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.634723Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:49ad72ba49a33f8bdb4ee3c9f0d3702c5442d719b6ffe7a74ec2375d28f6c692","observation_id":"22716251-6203-4a62-82f4-731b6ca1ba61","resolution":{"observed_at":"2026-08-09T10:37:04.473837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.454387Z","title":"Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering","venue":null,"work_id":"01adf50b-4b82-489c-a2fb-1a02f3c13b73","year":2023},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.643592Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:309383716213f3b79965b8d446826a46a59636f50998a8ff52eb2ec6f14af84b","observation_id":"949cdf6a-c968-43eb-a060-482e25189ce8","resolution":{"observed_at":"2026-08-09T10:37:04.459166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-12T23:45:23.184366Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-09T10:37:03.648039Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.648039Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:e6e779bc11a77b668122f8ecd3b64a300cfdd0b642e48d043c0ab278d3c454b3","observation_id":"12f57c02-ea07-424d-9f4b-e8d8571dd0f1","resolution":{"observed_at":"2026-08-09T10:37:03.648039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04001","last_updated":"2020-04-08T14:17:31Z","snapshot_observed_at":"2026-08-10T10:12:10.985137Z","submitted_at":"2020-04-08T14:17:31Z","title":"Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2004.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.04001","snapshot_observed_at":"2026-08-09T10:37:04.053521Z","title":"Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement","venue":"eess.AS","work_id":"2963dc55-a42d-456c-a898-353cc3e655fa","year":2020},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.652516Z"},"links":{"cited_paper":"/paper/2004.04001","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:ce1a2eeb1ece15509c2ea3a0c4445ddcfbbac582305447797acb2943cab94f80","observation_id":"873e4451-21d3-4a4d-a091-16da579da7c4","resolution":{"observed_at":"2026-08-09T10:37:04.059313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13731","last_updated":"2021-10-05T15:52:27Z","snapshot_observed_at":"2026-08-13T18:03:37.565208Z","submitted_at":"2021-09-28T13:51:16Z","title":"VoiceFixer: Toward General Speech Restoration with Neural Vocoder","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13731","snapshot_observed_at":"2026-08-09T10:37:03.661876Z","title":"V oicefixer: Toward general speech restoration with neural vocoder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.661876Z"},"links":{"cited_paper":"/paper/2109.13731","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:7dc9ceb609f75f0c5409b54420a2a155dc2a29877b927110135026d4fb12227c","observation_id":"76e3ce1d-53e6-45d8-9dea-2b7133e179f0","resolution":{"observed_at":"2026-08-09T10:37:03.661876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-08-13T00:17:59.506062Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-09T10:37:03.666522Z","title":"Se- manticodec: An ultra low bitrate semantic audio codec for general sound","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.666522Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:603ad071b70599abfa31bc2ffb1dc1a62ccc31486c5a387e4cd7579e5df3199a","observation_id":"b44fc7fe-1069-487b-b416-2d2cd9e14006","resolution":{"observed_at":"2026-08-09T10:37:03.666522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.439700Z","title":"Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement","venue":null,"work_id":"7b078302-3559-4004-a960-4d53e21023c4","year":2020},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.671130Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:24e86586dd768eb8fdfb7309150614b8e46a8dbc6c9158bb660327292bfd17ae","observation_id":"21fbec8c-b87a-481f-b3a2-7836e1134c6f","resolution":{"observed_at":"2026-08-09T10:37:04.444577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-09T10:37:03.675402Z","title":"Finite scalar quantiza- tion: Vq-vae made simple","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.675402Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:0831f46653428a993baeb3218e6944c121ff7e265e0d202d80cbf382130550b0","observation_id":"17a3139c-8abc-47f6-aac1-38c28d6113b0","resolution":{"observed_at":"2026-08-09T10:37:03.675402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.424836Z","title":"Dnsmos p","venue":null,"work_id":"650784e7-22c9-4831-aa14-0e27a7ea6a6d","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.684725Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:4e16c6dbf46a8caed04fb94ca59b5427262a1907d2e97b8191cb4558a7956a7c","observation_id":"6acf754b-dbc7-405d-9b67-22473d9c8e3c","resolution":{"observed_at":"2026-08-09T10:37:04.429747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.409519Z","title":"Fewer-token neural speech codec with time-invariant codes","venue":null,"work_id":"93ecc652-4a70-4d97-a633-489f28486262","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.688823Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:78bfaa0056065f0978ffecd3f941f70557fbf76e9da3099c19e6f1883066c651","observation_id":"55d42621-87a4-4fd1-9fda-f5cc23ccb46d","resolution":{"observed_at":"2026-08-09T10:37:04.414676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-13T16:08:20.566487Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-09T10:37:03.693127Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.693127Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:056b6af09d7f00a290c524417300fb1077fd5f3d86c0ad8db13cb0416bf0b698","observation_id":"fe002d0a-cc8c-41e1-a026-f26f74bb9db9","resolution":{"observed_at":"2026-08-09T10:37:03.693127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12194","last_updated":"2024-06-18T01:49:00Z","snapshot_observed_at":"2026-08-14T04:30:37.574762Z","submitted_at":"2024-06-18T01:49:00Z","title":"Universal Score-based Speech Enhancement with High Content Preservation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12194","snapshot_observed_at":"2026-08-09T10:37:03.697677Z","title":"Universal score-based speech enhancement with high content preservation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.697677Z"},"links":{"cited_paper":"/paper/2406.12194","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:d549a2457d99f5c9ff7ad69da725c1c1704066ebe05078d8f313156dc53bf506","observation_id":"c76a641e-ac99-424b-84f4-67a3546f93d4","resolution":{"observed_at":"2026-08-09T10:37:03.697677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-13T11:27:10.322532Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-09T10:37:03.701969Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.701969Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:b0f5075d4972c95a3cb54fa13f70d54adf9795886951ebc3ff9acd0ed6108aa8","observation_id":"acc77a20-f55a-4746-86b1-74de8fce3ff3","resolution":{"observed_at":"2026-08-09T10:37:03.701969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.394157Z","title":"The voice bank corpus: Design, collection and data analysis of a large regional accent speech database","venue":null,"work_id":"1bf95d51-cda4-481e-9127-1a78058aad1f","year":2013},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.706795Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:e888c4c982bb278c2509d57f2b67f556257d6427328852eaa751337b5b89dd3f","observation_id":"b30ab931-29a9-4a06-b78d-1c13f78ceb4b","resolution":{"observed_at":"2026-08-09T10:37:04.399196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01160","last_updated":"2019-07-02T04:27:55Z","snapshot_observed_at":"2026-07-06T08:04:17.909965Z","submitted_at":"2019-07-02T04:27:55Z","title":"WHAM!: Extending Speech Separation to Noisy Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01160","snapshot_observed_at":"2026-08-09T10:37:03.716408Z","title":"Wham!: Extending speech separation to noisy environments","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.716408Z"},"links":{"cited_paper":"/paper/1907.01160","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:cd985fac9ec37dccd4f4936ee486578d75d0d190f86221dda39264d83adbfb8a","observation_id":"464655a4-19bf-40e4-abcb-5fcbbed33fcb","resolution":{"observed_at":"2026-08-09T10:37:03.716408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.378499Z","title":"Audiodec: An open-source streaming high-fidelity neural audio codec","venue":null,"work_id":"bc585c55-ebdd-4c7e-9e68-19cf27bf6bc7","year":2023},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.722180Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:febe3c83d8a8426aa8dd8f08a74b521c1d0eb4544eb46f4ce6afa84e00a13adb","observation_id":"afa3289d-9183-4eda-a8c8-8ba17ff32094","resolution":{"observed_at":"2026-08-09T10:37:04.383185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-09T10:37:03.726917Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.726917Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:35f07103520ba4670feb5be7c8aba6519d6757e49fcf647bfb73c28e58e56ed6","observation_id":"1322981d-a653-44ed-a58f-ded95262096f","resolution":{"observed_at":"2026-08-09T10:37:03.726917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-09T10:37:03.731933Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.731933Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:fcd9616a6d9f2fcb121a9ddede1b914e881d44a1d7e01b4511385db5c9d81185","observation_id":"d9203ab6-3161-42cd-8002-275405161514","resolution":{"observed_at":"2026-08-09T10:37:03.731933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10642","last_updated":"2024-09-23T22:57:44Z","snapshot_observed_at":"2026-08-13T04:17:37.791966Z","submitted_at":"2024-02-16T12:43:01Z","title":"Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model","version":2},"cited_work":{"arxiv_id":"2402.10642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10642","snapshot_observed_at":"2026-08-09T10:37:03.837653Z","title":"Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model","venue":"eess.AS","work_id":"4452768d-0cbe-48a4-89c3-f3ff7e01ae4d","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.736696Z"},"links":{"cited_paper":"/paper/2402.10642","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:801372e0e3a63f85aaab6eef3b497c630de6449b891923bdee135326096831fa","observation_id":"d0c6c1ff-b73b-4952-93c3-ec6c44925d76","resolution":{"observed_at":"2026-08-09T10:37:03.844720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-13T10:23:26.896178Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-09T10:37:03.741448Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.741448Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:4e83baf0934c7a52c0f8e7e3e6012fa55a21a20a25e50fd7de7673214f5d2038","observation_id":"5cc50158-7a0e-45a4-ac35-9bf2cd84f3ad","resolution":{"observed_at":"2026-08-09T10:37:03.741448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.363425Z","title":"We discuss several common questions for the design of GenSE","venue":null,"work_id":"c9f95d15-092c-405f-bb35-6d6d167b1738","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.746318Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:66850420916b042795322be55ae5cbc7f3c1dcb024a0a0eb0a9da6312ee288ac","observation_id":"7ef73369-47ff-47a4-8da5-f840c90aaa53","resolution":{"observed_at":"2026-08-09T10:37:04.368095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.348634Z","title":"On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities","venue":null,"work_id":"48fbb978-c8a1-4de9-81e5-600c6fdb0e09","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.751285Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:ca4155dc02037a6ac4bcfb92f7324463a3ae445d50649d09e63888da8460a0e8","observation_id":"abf7d858-0d37-46c7-ad03-e6066347135e","resolution":{"observed_at":"2026-08-09T10:37:04.353500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.331744Z","title":"To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure","venue":null,"work_id":"f35fe41c-41d1-4eb2-b58d-100e971faa46","year":2022},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.756648Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:4141a0d5908509c0389c917125e3d0f69c7c8da51fef15521347e2887da99c8b","observation_id":"c74d7a16-07f5-49f5-bded-6d167a258413","resolution":{"observed_at":"2026-08-09T10:37:04.337453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.315800Z","title":"No Preference","venue":null,"work_id":"4baf0aeb-9292-49a4-82f7-a89627b5c810","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.761784Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:0d7d991406d2baab92590a83677d29273510d68d62d8ef100650a9ac296353e2","observation_id":"3d73fd3b-356c-4181-a7f4-f86cd57c86b2","resolution":{"observed_at":"2026-08-09T10:37:04.320599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.269213Z","title":"We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality","venue":null,"work_id":"0adb66ec-1b61-4576-ac55-94e31e476f93","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.776701Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:620f08fa7bf100b594ec6dd0f1dea69b54cb907c3ffdf6fcdec033d5e143e743","observation_id":"36e4c198-c62a-4e1c-a0e0-5a05278cb404","resolution":{"observed_at":"2026-08-09T10:37:04.273771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.299756Z","title":"We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model","venue":null,"work_id":"5e5608be-25d9-4e59-b3d2-acbab4a24995","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.767028Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:d70780b777aaaf914afb1fc80e48e529a01938129318eb64ba0b9c37121b95bf","observation_id":"12ea5c2a-2b9b-40a2-965f-1b5b29361e4c","resolution":{"observed_at":"2026-08-09T10:37:04.305095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-09T10:37:03.711308Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.711308Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:cf6bd3b0d09e97de6ee88dfe8383c7e5a15e5fd253ba572eac2f43716c8877bb","observation_id":"e5545a6d-5a73-46d4-8d01-d56cb98ebb8f","resolution":{"observed_at":"2026-08-09T10:37:03.711308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.01902","last_updated":"2021-04-05T01:19:31Z","snapshot_observed_at":"2026-08-13T20:34:45.678293Z","submitted_at":"2021-01-06T07:46:25Z","title":"Interspeech 2021 Deep Noise Suppression Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.01902","snapshot_observed_at":"2026-08-09T10:37:03.680242Z","title":"Interspeech 2021 deep noise suppression challenge","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.680242Z"},"links":{"cited_paper":"/paper/2101.01902","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:cf466d4bb6cb07feae624b6dc5013e393b4f5a9deb3b099f5d56e9e61816ddec","observation_id":"a752c229-8f33-415f-8e9c-fcfa022b4eb1","resolution":{"observed_at":"2026-08-09T10:37:03.680242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.557753Z","title":"Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec","venue":null,"work_id":"fb94d63b-d93d-48a4-81b8-660b1f9c6aa1","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.585622Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:622eb9ebc325cb6d453e644dad94976e86a03133d6d4dabfc4432222186e6516","observation_id":"df688006-3bb2-455e-8e55-212d5ed86908","resolution":{"observed_at":"2026-08-09T10:37:04.562354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11362","last_updated":"2020-10-22T01:00:23Z","snapshot_observed_at":"2026-08-06T08:52:24.459809Z","submitted_at":"2020-10-22T01:00:23Z","title":"NU-GAN: High resolution neural upsampling with GAN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11362","snapshot_observed_at":"2026-08-09T10:37:03.638921Z","title":"Nu-gan: High resolution neural upsampling with gan","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.638921Z"},"links":{"cited_paper":"/paper/2010.11362","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:26634a2c8df7c4b0c5f9a0f271b670633a010edd9e2a150d617dac1d8fe658f3","observation_id":"dc161ac4-b595-45a0-b79e-f979fe65ab21","resolution":{"observed_at":"2026-08-09T10:37:03.638921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16321","last_updated":"2024-02-26T06:01:38Z","snapshot_observed_at":"2026-08-13T04:10:21.442771Z","submitted_at":"2024-02-26T06:01:38Z","title":"Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech","version":1},"cited_work":{"arxiv_id":"2402.16321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16321","snapshot_observed_at":"2026-08-09T10:37:04.162043Z","title":"Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech","venue":"cs.SD","work_id":"1cbb0ce2-3a1a-4c8d-956f-472111099fee","year":2024},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.599883Z"},"links":{"cited_paper":"/paper/2402.16321","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:0d815f306f6b739a5df08e4cfde589097af8dc81cdbcabf5f671ce36f2e100e4","observation_id":"6c4c018e-0e23-4898-976b-24d6cfb1cec1","resolution":{"observed_at":"2026-08-09T10:37:04.166692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-12T22:09:18.259155Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-09T10:37:03.657296Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthe- sis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.657296Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:2500a35d8d40f4ca27e9903a5eed62b59317ea606a26e47f17fb08916dbb3088","observation_id":"9c711ee6-7141-46e4-a003-909bbdfd5f41","resolution":{"observed_at":"2026-08-09T10:37:03.657296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.527646Z","title":"Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement","venue":null,"work_id":"cddfe503-a7d1-45ee-b44a-8502916d6a5b","year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.595122Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:9dfb64985be0e513769e70a2cf746f77f63302a8564618b334881b8eeb53cf14","observation_id":"32685557-cfe0-42df-8a48-0100d4aa5dea","resolution":{"observed_at":"2026-08-09T10:37:04.532634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-13T15:51:23.221137Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-09T10:37:03.566091Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.566091Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:b175bcf6069c4ef83a435d89cd7cd38e8f5661e3ef55a13a8195c4008250a867","observation_id":"48941f34-dddc-46bc-9f8d-d1e66e99fbc8","resolution":{"observed_at":"2026-08-09T10:37:03.566091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-13T04:02:54.961180Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-09T10:37:03.625975Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factor- ized codec and diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.625975Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:43981d85f44785560991cf072ba1c782fb28e4b28a246230488f9c3f6d6df696","observation_id":"72b5b59b-50fd-4783-9f12-2e1ab27da007","resolution":{"observed_at":"2026-08-09T10:37:03.625975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:37:04.572166Z","title":"Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,","venue":null,"work_id":"59aa9923-a833-4231-b434-7033e2566f61","year":2025},"citing_paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T10:37:03.561414Z"},"links":{"citing_paper":"/paper/2502.02942"},"observation_digest":"sha256:3528af442c200385affc82d9287b3b7c546b41157b5687f5de0c527381bd8655","observation_id":"31880e8c-2126-42e5-8443-ce43a3992637","resolution":{"observed_at":"2026-08-09T10:37:04.577005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02942","last_updated":"2025-02-05T07:14:39Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T11:06:44.002726Z","submitted_at":"2025-02-05T07:14:39Z","title":"GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2502.02942."}