{"as_of":"2026-08-11T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71d067836da8a023cac9aac48182b5ad4eb3c62dc1c740d83e471f4e5b2a5cef","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T09:32:41.384274Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T09:32:41.384274Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T09:49:44.175454Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"cited_work":{"arxiv_id":"2606.22591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22591","snapshot_observed_at":"2026-07-04T09:49:44.175454Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","venue":"eess.AS","work_id":"919a44e5-29a1-4049-bfaf-d3b4788a5761","year":2026},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"cited_paper":"/paper/2606.22591","citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:d76c77f772d58cd0fd573046ea7c06219d660b8c698ceca87dbc36f33624806e","observation_id":"ff37d845-5a3a-4df1-8b90-ea7d8b89a89d","resolution":{"observed_at":"2026-07-04T09:49:44.176770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.22591/citation-record","integrity":"/paper/2606.22591/integrity","json":"/paper/2606.22591/citation-record.json","paper":"/paper/2606.22591"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:f9f03678045e9f3569a9936a17c859e633b827e9ddc596fa27c7ead6baa87236","observation_id":"f6561322-1102-4acd-85f2-dcd9f621160e","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"cited_work":{"arxiv_id":"2606.22591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22591","snapshot_observed_at":"2026-07-04T09:49:44.175454Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","venue":"eess.AS","work_id":"919a44e5-29a1-4049-bfaf-d3b4788a5761","year":2026},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"cited_paper":"/paper/2606.22591","citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:d76c77f772d58cd0fd573046ea7c06219d660b8c698ceca87dbc36f33624806e","observation_id":"ff37d845-5a3a-4df1-8b90-ea7d8b89a89d","resolution":{"observed_at":"2026-07-04T09:49:44.176770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4552.83933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:49:44.180744Z","title":null,"venue":null,"work_id":"d9b89b23-7e8d-4ea9-b505-e4789fa2c551","year":null},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:589330c7b031563371b09a17bc20067f6f92224134b116ee5750fa1c1b7edf66","observation_id":"60522f98-5c34-4b37-9bf8-ffbbee273bd4","resolution":{"observed_at":"2026-07-04T09:49:44.182887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Datasets and Setup Dataset.We first train and evaluate on the V oiceBank- DEMAND (VB-DEMAND) dataset [29], a widely used bench- mark for speech enhancement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:4fe969f6dda94762717d575871d9234aee8178707c42f54e736e89d475263f5d","observation_id":"c21b3105-1ffe-43b7-8467-544999216dc1","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Both use a frozen wav2vec 2.0 base model [12] for feature extraction and a three-layer MLP as the FiLM genera- tor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:b8ad08689e32e1fb3756c461d70981f023d2a28b29fd748d5c3cc60fb8be911e","observation_id":"293e0e17-a8ef-4bc1-8f43-c18ad1eff952","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:3a4d31533bc72986178189a474e8b6c48786e7dc223d57857257e654830678cb","observation_id":"6b7b0173-1324-4152-8688-b0c8e7a74bad","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"They were not used for idea formulation, experimental design, or generating significant portions of the text from scratch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:b17f1720c271f3ced7ffb31507a5456daf6635a97e5a5c5d1bad0332917c2abb","observation_id":"61825ec2-f10b-4ac9-bc6a-663ecc524299","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:d175358a7d32acb950658d839dada8d38510e02867bf780619cebea4d0b32b51","observation_id":"daaaaf00-c9c7-42a1-af8d-78101039dd68","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"On training targets for supervised speech separation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:2d3bebe4120023e14d97b06399e17a070456498063dc196eada536ba91712782","observation_id":"7b5f9a4c-c234-4dd0-9f33-025829f59427","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Complex ratio mask- ing for monaural speech separation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:44b04474b5876b9749483b057fcd1934e1918ca6474632a683e41edd7b8a851a","observation_id":"c947e21d-7ab8-43c5-b5ac-e59b561ef083","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Conv-TasNet: Surpassing ideal time- frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:509a2bbc2ea573b0840b365df19132f4aa8ebca815eb1b55f2437c3b77b25fff","observation_id":"8e7954ad-8482-4cd0-99d0-b2ec0efe8142","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:5fb1bc85b5e7b89d00d76e6ad3e3e31568399e93c11091f1002277d0a43fb5fa","observation_id":"42515dea-012a-4c06-b436-e817b5fb8a73","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Conditional diffusion probabilistic model for speech enhancement,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:495b8a4a1245e350ed5a7826e664e3eb96fefdf9bc84c57f62a512d374ae70a6","observation_id":"23c1e63a-2bcb-4d4e-a08b-1cca292f7e1e","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Speech enhancement with score-based generative models in the complex STFT do- main,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:eaa9604f991bdb00266b124391a258a1895bbff535d2e4b207835f58c5df1a2b","observation_id":"c616d746-48a6-4f1b-afe1-605ebe63c6c3","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:e12fb86a06534b779347a0e4b684f2782f72dd94378b381a5487654bc4c95e17","observation_id":"3364e995-ae2e-49c3-9fb5-3a7d1bfd71fc","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03065","last_updated":"2022-09-16T10:27:27Z","snapshot_observed_at":"2026-08-09T14:32:30.515268Z","submitted_at":"2022-06-07T07:32:32Z","title":"Universal Speech Enhancement with Score-based Diffusion","version":2},"cited_work":{"arxiv_id":"2206.03065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03065","snapshot_observed_at":"2026-07-04T20:20:07.697436Z","title":"Universal speech enhancement with score-based diffusion.arXiv preprint arXiv:2206.03065","venue":null,"work_id":"22542497-20d4-4317-92f8-dd9c85fea1fd","year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"cited_paper":"/paper/2206.03065","citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:c5afd05fb89a8c75b85564e26205354369aa028a035f47117c462c3e182488c2","observation_id":"39cb466a-4861-4846-85c3-0fe409b74a37","resolution":{"observed_at":"2026-07-04T09:49:44.185881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"UNI- VERSE++: Trainable multi-codec neural speech enhancement with multi-stage discriminators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:5c596c86991cda4798a0ee4a1f79d3fa48f5e0a3f14e17b3c455201e468a3ea7","observation_id":"a833ccf6-b0c8-47d5-96d7-d03f5cb2fa87","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:a55b7d92be1d543b2e3e4646aa4cb443c625b066ba71b14f8363af03019b6300","observation_id":"68deeb01-1b7e-4e7b-ab89-f0708f152dc5","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:2ca410f1b34e37abae6c4788896dc1eca0c6184c930b15b417113fffbe1ff1d2","observation_id":"277bbb3b-e78b-4e6e-889f-a9eae0e9ca6f","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:218a7d4ffc7aa07dc314a224ba79bcd367cfef307f98403e31be6f9b2bf8330c","observation_id":"1cf7e95a-ab96-4aad-9378-3eea8b761b3c","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Investi- gating self-supervised learning for speech enhancement and sepa- ration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:5b71b75f6f4dbca22f1530636083b731f849537b87323d87115b6c42b13f6f87","observation_id":"8c23938c-81d3-44a5-8f73-ddfda8972444","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03339","last_updated":"2022-07-05T12:30:18Z","snapshot_observed_at":"2026-07-06T12:57:47.412026Z","submitted_at":"2022-04-07T10:22:26Z","title":"Boosting Self-Supervised Embeddings for Speech Enhancement","version":2},"cited_work":{"arxiv_id":"2204.03339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03339","snapshot_observed_at":"2026-07-08T07:34:43.133145Z","title":"Boosting Self-Supervised Embeddings for Speech Enhancement","venue":"eess.AS","work_id":"f1ce3a09-0b6c-460c-99a8-cb9087f20387","year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"cited_paper":"/paper/2204.03339","citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:1e341b98cbf7b0e532dd8db477aee357fe5cb21d0d721050b76d683167dbe278","observation_id":"7dcfcac4-c9a9-4b40-857f-383eb83a1590","resolution":{"observed_at":"2026-07-04T09:49:44.189138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Self-supervised speech rep- resentations for speech enhancement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:ff586599f14aed48ca0323ed20bc75c1237323266a3bd36a0e856c5646c84f2a","observation_id":"d6515d84-1ad0-443b-a80a-cebde3ad6083","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"FINALLY: Fast and universal speech enhancement with studio-like quality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:2982151fe550a8e9e651fcf30f188ee10b8528485fa58ebe69d0e8dd2ab11d2f","observation_id":"1ec36284-54e2-4054-8dae-9c2765178652","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Discrete token based speech enhancement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:4f6b3bd75de03863fe832a037ae39da1ed6831f3bc7a3114b6b8b5661fa496f6","observation_id":"ca1782f5-a37d-483b-a030-c2e2159cf307","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:ad509e989bfc6b93c3676226bd9e2a9cbf3554b5d208d69d9a1dfcb35a1e999a","observation_id":"2a763db0-2b2e-4b60-8073-c9dfb7b5259f","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Diffusion models beat GANs on im- age synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:c622e323ec1a972a93362abc2cb4bbd8eabd8f8f6b112c923f2de5494e8ca626","observation_id":"ee75c8f6-249c-4d0b-ad68-65d082bad592","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:5566ab516cfc5deef8f5e4a5420f6888c58c429231b43bfcfc9317f48d9e8a2e","observation_id":"1e683a7e-506d-4370-9c3b-863082fa8690","resolution":{"observed_at":"2026-07-04T09:49:44.179276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:379e29512643794ca5ae359ac24f00408c859238fb00c7e3772970a3e792c275","observation_id":"c126116e-d8d4-4742-b0a6-ce20bb7d6e72","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:c77e941401ebc2c63f792b65ca95061b44f0e72450458e4b9995059797ae6b0b","observation_id":"14b56271-8c34-40ab-bbbb-2ea9673ed27b","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"StoRM: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:0042f79df22483247bd4d153a8e2720576014df201137d33578b46b9df7b0f04","observation_id":"0b8c8281-5e1f-4995-a34e-4d9a830757c2","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"GAN-based speech enhancement for low SNR using latent feature conditioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:c7d77a92f11183e0a3cb44540dd191a0d93d711ac47be11904c9451daceadc81","observation_id":"8a43440d-d45d-40b3-a543-b27067bb6d44","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:eacd533134865b2a729a763c1b846b90f33083a8778b8e0201265a06085e6cce","observation_id":"f78282db-cc08-4e4a-bada-1f835e4ae2d2","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Robust wav2vec 2.0: Analyzing domain shift in self- supervised pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:79e85d8a0479882ff030d551d152e9999a68e1cf033985d660c4eb40a0d3e702","observation_id":"d73b0aee-943f-4fd3-ac9f-f5a26cfc5762","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"In- vestigating RNN-based speech enhancement methods for noise- robust text-to-speech,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:648185d897306c0cd02891e92926034a008465f99a62dd314b322954b2f444b4","observation_id":"2a44f992-87a3-453e-8b43-9a254f2e5e21","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"The voice bank corpus: De- sign, collection and data analysis of a large regional accent speech database,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:27673285331476cb4e084327e50a912d2e3526dbb7eee831c7e48efa2557e3ce","observation_id":"a301213b-e765-411e-97bd-fe0425521964","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"The diverse environments multi-channel acoustic noise database (DEMAND): A database of multichannel environmental noise recordings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:577b5f11eb51be64df46c6bd3163da7ecaa376fdf9832435967987566610e88d","observation_id":"40d1468f-12a0-499f-90b8-1b61ce8c4e97","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"Per- ceptual evaluation of speech quality (PESQ)—a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:c7af75b6cee60fb2f6083b0db956d9c8206b3be5e36c97bc509e53ddcb9dad97","observation_id":"88c8279d-b984-46cc-b4d0-52b5901828e6","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"An al- gorithm for intelligibility prediction of time-frequency weighted noisy speech,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:dbb93644828570caf488a7bda8280f9232b033ccf69ec6dc85216dc9cb863842","observation_id":"eee72ebe-f101-49a8-bff2-cf8259d1127c","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"SDR— half-baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:a3d5f582383e4458aa961749edad1e0ab320db52ea1657596d7f637fbdfa9a54","observation_id":"bf24c425-58e3-4cb8-8196-91fac61e02fa","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:32:41.384274Z","title":"DNSMOS: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T09:32:41.384274Z"},"links":{"citing_paper":"/paper/2606.22591"},"observation_digest":"sha256:5906dafa0ad7f6b1c73b4006f0548110511144cfba1ca9b00b8caf5b25d0517e","observation_id":"5d52a20b-1ec6-4c67-a38c-b54239751626","resolution":{"observed_at":"2026-06-26T09:32:41.384274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.22591","last_updated":"2026-06-21T16:56:21Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T02:36:25.628398Z","submitted_at":"2026-06-21T16:56:21Z","title":"Bridging Self-Supervised Learning and Speech Enhancement: A Wav2Vec2-Conditioned Framework"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2606.22591."}