{"as_of":"2026-08-20T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:120831717461074af79fdb3ce3dd802bdf3b80aa2d8919b58d2f2fb7e1c2a8e4","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:22:07.475291Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:20:49.132229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19314","snapshot_observed_at":"2026-08-03T14:20:49.132229Z","title":"Solospeech: Enhanc- ing intelligibility and quality in target speech extraction through a cascaded generative pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-19T07:59:48.925532Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.132229Z"},"links":{"cited_paper":"/paper/2505.19314","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:5aed234ba76221f3f01575d26dff99f79bbf4562c522785533d9182d637ea9bb","observation_id":"cc329c18-7386-4acd-8846-95a8f1672c13","resolution":{"observed_at":"2026-08-03T14:20:49.132229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19314","snapshot_observed_at":"2026-08-02T22:51:20.849476Z","title":"SoloSpeech: Enhancing Intelligi- bility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15519","last_updated":"2026-06-08T11:40:00Z","snapshot_observed_at":"2026-08-09T04:37:03.295131Z","submitted_at":"2026-02-17T11:47:56Z","title":"Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:20.849476Z"},"links":{"cited_paper":"/paper/2505.19314","citing_paper":"/paper/2602.15519"},"observation_digest":"sha256:78170b4365fc09b8701640d06baf1f2802b7f46c2e36e29402c2086a4c66fd67","observation_id":"0293e581-3ff6-4913-8d5f-4960ebfa64ed","resolution":{"observed_at":"2026-08-02T22:51:20.849476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19314","snapshot_observed_at":"2026-07-13T17:09:15.281290Z","title":"Solospeech: Enhancing intelligibility and quality in target speech extraction through a cascaded generative pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27205","last_updated":"2026-06-21T01:18:38Z","snapshot_observed_at":"2026-08-17T23:48:43.606503Z","submitted_at":"2026-03-28T09:14:41Z","title":"Beyond Acoustic Prefixes: Persistent Grounding in Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T17:09:15.281290Z"},"links":{"cited_paper":"/paper/2505.19314","citing_paper":"/paper/2603.27205"},"observation_digest":"sha256:7823cd5abe5f57d5470b7dd6fd6b964ae92c45564a6afe947e69c4e52f1d8198","observation_id":"29ebe771-cc57-4139-8478-42c13570334e","resolution":{"observed_at":"2026-07-13T17:09:15.281290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19314/citation-record","integrity":"/paper/2505.19314/integrity","json":"/paper/2505.19314/citation-record.json","paper":"/paper/2505.19314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:16.236290Z","title":"The cocktail-party problem revisited: early pro- cessing and selection of multi-talker speech,","venue":null,"work_id":"34b0a595-7d18-48b5-bc25-f3f9428b687b","year":2015},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.154451Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:534fc8b80fd01cc866e629c328ca98a9637e8e6e1a5e6d19e8a3b671fe019256","observation_id":"d86250cd-c963-4ac1-9256-ddbe38fad0ee","resolution":{"observed_at":"2026-08-07T14:22:16.316621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:16.119104Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"890ec36b-4e41-49e8-8c74-c89bab85e147","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.158760Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e1843b321e9ec1f334af30b2a417d431d01820acb9dd9a92caadb625920f7be2","observation_id":"d24a1ce8-4e6c-4d93-9999-a8c2e4cf756a","resolution":{"observed_at":"2026-08-07T14:22:16.167867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.985401Z","title":"Neural spatial filter: Target speaker speech separation assisted with directional information,","venue":null,"work_id":"0c6477f8-41eb-41f2-9961-2c1bfbe981ad","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.163056Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:02cf52a5fd2019c81292c2584da2ed7b20bba3aee17fbe4557a2556d5108d634","observation_id":"a5f4c12f-df00-4fbe-9813-b06d63e71704","resolution":{"observed_at":"2026-08-07T14:22:16.021303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.537800Z","title":"Far-field location guided target speech extraction using end-to-end speech recognition objectives,","venue":null,"work_id":"b592ad31-d477-4df5-83bb-d88f1850c3ae","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.168216Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:b318c88be47eb8fcad8e7b14ec446c4712fc19b4f35b0527fc9caf755ffadabe","observation_id":"8b003eec-47d2-42bc-b634-cecfc738d80d","resolution":{"observed_at":"2026-08-07T14:22:15.913298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.350971Z","title":"Looking to listen at the cocktail party: a speaker-independent audio-visual model for speech separation,","venue":null,"work_id":"4484a070-8fd4-4164-b9d1-97be6a7addda","year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.171996Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:07fc225b35ecb6640ab75d63c8b64eaf7067860fa2e71d3f3ab2729936bef706","observation_id":"1eedf57c-0046-4639-a424-985e93779fbf","resolution":{"observed_at":"2026-08-07T14:22:15.435237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.201990Z","title":"Conceptbeam: Concept driven target speech extraction,","venue":null,"work_id":"a3f274ad-abb1-4ff3-b85c-8329a0b49ffe","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.176146Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:41d2328e679a337ac6f9dae06a4dd45eed3a2752bf70b96f337d272310ad38f7","observation_id":"27460b18-8024-4c28-a89d-4479dbe0a0ef","resolution":{"observed_at":"2026-08-07T14:22:15.283829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:15.071396Z","title":"V oicefilter: Targeted voice separation by speaker-conditioned spectrogram masking,","venue":null,"work_id":"b71f9bb9-2f60-45cb-b605-34a2025de488","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.180844Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a57fcf91aeee39432b06fd15f3abaca3e1c9402aefb0cdc99f345f58df72cadf","observation_id":"693bb2b9-cf52-4e47-8d02-945d341d136c","resolution":{"observed_at":"2026-08-07T14:22:15.164815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.923821Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"5baab1ca-31a9-4af0-bfa7-d0c0e58583df","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.184966Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0c322987cb5b0afd1b43111d37c313bd308a8ff9ff822b88a007031ab18f934a","observation_id":"930acadf-25cf-4460-b1bf-70371d4bf6ca","resolution":{"observed_at":"2026-08-07T14:22:15.002077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.820490Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,","venue":null,"work_id":"5442465c-c7b2-49bb-95f4-42553bef56b9","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.188682Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:69d2789e3c4c9101c8156efea52b3bb61fa5a338e1e642751840984815195e1c","observation_id":"33604da3-1634-4163-ac55-ae8543afb007","resolution":{"observed_at":"2026-08-07T14:22:14.875258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.706947Z","title":"Target confusion in end-to-end speaker extraction: Analysis and approaches,","venue":null,"work_id":"a50fcfa1-101e-4dd9-a17e-1573b7a2ef56","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.192850Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ad3aaeb0c3db5fbb3a2adac5e1c847f4473363aa0dac90f74617f2c3ca4ca9ee","observation_id":"460ed315-7fe9-41ff-b469-ddcbc96234dd","resolution":{"observed_at":"2026-08-07T14:22:14.758242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.592313Z","title":"Dpccn: Densely-connected pyramid complex convolutional network for robust speech separation 11 and extraction,","venue":null,"work_id":"c934db80-b9f2-46a6-9ea1-e81da7e7888b","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.196434Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:167972399d84e88236f1646463831af3ac7d5d64239c349645c5d57f5e6768f4","observation_id":"f22eb8bc-4f60-4f6c-803d-194c16e497aa","resolution":{"observed_at":"2026-08-07T14:22:14.633307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.436335Z","title":"Improving target sound extraction with timestamp information,","venue":null,"work_id":"fffa703e-2e4c-441b-a823-a70f8f281647","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.200583Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:060e0e60844f13b79e8eff921967004a43ea227a2488c94bb405ca4e1d52c29a","observation_id":"a5f74896-a48a-44e2-a4d5-4a405cdc5bdc","resolution":{"observed_at":"2026-08-07T14:22:14.516695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15799","last_updated":"2024-09-24T06:47:12Z","snapshot_observed_at":"2026-08-20T05:56:35.532252Z","submitted_at":"2024-09-24T06:47:12Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15799","snapshot_observed_at":"2026-08-07T14:22:07.204106Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.204106Z"},"links":{"cited_paper":"/paper/2409.15799","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:dff036e2efdfe1f524ebe3810cacb5b8116bf703a42e6d2089e165cac4974e7d","observation_id":"610f6f0c-164e-427f-ad8d-55bce01922a0","resolution":{"observed_at":"2026-08-07T14:22:07.204106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.292649Z","title":"Spex: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"5b66cdee-e28c-43bb-ae16-0bcab6a3d549","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.208667Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8771d52fd56ff5a0796609670ee3b7d6d5c78fb64c6f39265c978a7231961f60","observation_id":"611ca561-de03-4463-8427-7df5c5ba0e9c","resolution":{"observed_at":"2026-08-07T14:22:14.357625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.188268Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":"c25cf6b4-8464-42df-87d6-1c171ded2d1d","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.212662Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:9ec6719d71ad554ba3a5db14514e4ab5e1c847916ab97525085f6531010f04bd","observation_id":"3858436a-b8b9-43ec-9a1f-78e582e3d462","resolution":{"observed_at":"2026-08-07T14:22:14.233683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:14.061292Z","title":"X-SEPFORMER: end-to- end speaker extraction network with explicit optimization on speaker confusion,","venue":null,"work_id":"642b63ca-9710-4f1d-b5b0-33cfa12b1daf","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.216422Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a700328d06117fa9b6faa31cd41e40bd89af331ce7727e4824b960dfe5869a2a","observation_id":"85db493b-472e-4c86-895d-e4730dc4985c","resolution":{"observed_at":"2026-08-07T14:22:14.115190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.918559Z","title":"X-tf-gridnet: A time-frequency domain target speaker extraction network with adaptive speaker embedding fusion,","venue":null,"work_id":"1e275b45-8d05-4933-967d-a259e0cf38d0","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.221377Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fc7b2fc308cefb3e8b288c63002be729a6a1ae2dec00b742dc93c5ac551a54b1","observation_id":"8da9cead-1b4d-4c0c-877a-787dddb08cab","resolution":{"observed_at":"2026-08-07T14:22:13.979985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02615","last_updated":"2025-05-20T03:22:39Z","snapshot_observed_at":"2026-08-16T13:21:27.702697Z","submitted_at":"2024-09-04T11:12:30Z","title":"USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction","version":3},"cited_work":{"arxiv_id":"2409.02615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02615","snapshot_observed_at":"2026-08-07T14:22:07.830197Z","title":"USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction","venue":"eess.AS","work_id":"e7fbf494-185d-4cf8-aad4-054f5c917469","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.225317Z"},"links":{"cited_paper":"/paper/2409.02615","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:5f30039aba4f4f17b069adec54215b6ed2d125e193046e27ee5220f201c76326","observation_id":"1de9266a-258a-4493-b63b-e2782b33b22b","resolution":{"observed_at":"2026-08-07T14:22:07.834953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.758775Z","title":"Target speech extraction with conditional diffusion model,","venue":null,"work_id":"03a9cd00-36ca-4679-adbf-d6fb2317f340","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.230095Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:3451a79cb21fae7e8b9c1f108a0077e300b5ff5ca1af7149042c2ef018374594","observation_id":"ed61ae57-6b30-475d-b20a-a71d244102f2","resolution":{"observed_at":"2026-08-07T14:22:13.866038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07461","last_updated":"2024-06-11T17:08:21Z","snapshot_observed_at":"2026-08-20T05:55:44.461658Z","submitted_at":"2024-06-11T17:08:21Z","title":"Noise-robust Speech Separation with Fast Generative Correction","version":1},"cited_work":{"arxiv_id":"2406.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07461","snapshot_observed_at":"2026-08-07T14:22:07.813009Z","title":"Noise-robust Speech Separation with Fast Generative Correction","venue":"eess.AS","work_id":"47f625ef-3a30-4cd2-be1d-8c2a2a0ed8e6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.234297Z"},"links":{"cited_paper":"/paper/2406.07461","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:70bc4ce02363b413569048222994d64f8255eca8365b5f567dd74502ad6dfbe5","observation_id":"3f2ee616-3578-4865-9a29-f62fd92bdbb1","resolution":{"observed_at":"2026-08-07T14:22:07.817493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.612459Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":"b534234a-1712-4f03-adac-8c52721f69df","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.239647Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:d2e86d2373ca0eac326b84db8775208ba77c4778a02895aeb5054be598462fbf","observation_id":"9f531854-3c29-43d1-bf74-867007a691f8","resolution":{"observed_at":"2026-08-07T14:22:13.683036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.243716Z","title":"Diffusion-based generative speech source separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.243716Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:9e871dccc334e65abf2df755c3188ca9839bab8a9f3339b440ee26a13e0d7ed9","observation_id":"1c4af11a-89ad-4505-9ea5-a24441951168","resolution":{"observed_at":"2026-08-07T14:22:07.243716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.420084Z","title":"Generative pre-training for speech with flow matching,","venue":null,"work_id":"f98530d5-35f2-4275-a8f4-673ff4dca94f","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.248153Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4704039f411f80416c35bfeb4388456fd6e0d81beb88627ac1acb6330035a744","observation_id":"63742595-d3a9-4838-bd75-3a4f27419613","resolution":{"observed_at":"2026-08-07T14:22:13.475291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-07T14:22:07.252044Z","title":"Metis: A foundation speech generation model with masked generative pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.252044Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:7f8e21bbb6bdb5b07d9c991e68d80a15777cc9fb506cf68e5f46cf89110fc273","observation_id":"ffb056b2-5e5a-4357-a714-17287e0219e7","resolution":{"observed_at":"2026-08-07T14:22:07.252044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08425","last_updated":"2025-01-02T03:34:22Z","snapshot_observed_at":"2026-08-16T13:18:59.195877Z","submitted_at":"2024-09-12T23:12:25Z","title":"SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08425","snapshot_observed_at":"2026-08-07T14:22:07.256774Z","title":"Soloau- dio: Target sound extraction with language-oriented audio diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.256774Z"},"links":{"cited_paper":"/paper/2409.08425","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ea3ea0caed2b51f711cd6ec9c9910ea54e158f3e75e1fc77a6559a63238176e4","observation_id":"af0f0304-7d6e-4afa-91ce-5577d88b2cbd","resolution":{"observed_at":"2026-08-07T14:22:07.256774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10752","last_updated":"2023-06-24T05:28:19Z","snapshot_observed_at":"2026-08-16T16:00:09.832490Z","submitted_at":"2023-01-25T18:21:51Z","title":"Separate And Diffuse: Using a Pretrained Diffusion Model for Improving Source Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10752","snapshot_observed_at":"2026-08-07T14:22:07.261084Z","title":"Separate and diffuse: Using a pretrained diffusion model for improving source separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.261084Z"},"links":{"cited_paper":"/paper/2301.10752","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:847f17f483a09d6282d9d41a8499c46e4e629b90ea8fe26264538384662013e2","observation_id":"bf62dc7e-f961-46a4-be01-5f8568be862f","resolution":{"observed_at":"2026-08-07T14:22:07.261084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.265276Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.265276Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:9aae17d9e365e469299ac5b398cd4adebee2dd09447e983971bfc9dcd88d833a","observation_id":"eadbdd15-2a50-446f-88e2-1527b08990b5","resolution":{"observed_at":"2026-08-07T14:22:07.265276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.09785","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.774576Z","title":"Large language model based generative error correction: A challenge and baselines for speech recognition, speaker tagging, and emotion recognition,","venue":null,"work_id":"7278e4c5-90bf-4ec3-be8f-3da9c9780af6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.269521Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:04587e0a445cccd8ea49356f2beeefd7137871df2edb9cfe09cc61754fd7c1ec","observation_id":"17e636f9-cabc-4df8-b41f-2cbca8dbe101","resolution":{"observed_at":"2026-08-07T14:22:07.780630Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03273","last_updated":"2025-05-26T07:01:19Z","snapshot_observed_at":"2026-08-20T00:13:42.436149Z","submitted_at":"2025-05-06T08:04:37Z","title":"SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation","version":2},"cited_work":{"arxiv_id":"2505.03273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03273","snapshot_observed_at":"2026-08-07T14:22:07.706463Z","title":"SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation","venue":"cs.SD","work_id":"24b25144-5ac2-424e-a761-a74b3443cf28","year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.274041Z"},"links":{"cited_paper":"/paper/2505.03273","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:1dc3ce9ec5293ee57808c6566f81169ec16db802f9545b065e0e13f9a3fa4cd0","observation_id":"58f778a2-4cd6-4848-b207-4291a63e5542","resolution":{"observed_at":"2026-08-07T14:22:07.710817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T14:22:07.278378Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.278378Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:383eb5a294786b2c778edd3699fccf84c4cc5c481e0b467ab799704e8dd0a68e","observation_id":"ff992483-89bd-4c28-8710-1079063a1ac4","resolution":{"observed_at":"2026-08-07T14:22:07.278378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:13.173449Z","title":"Target speech extraction with conditional diffusion model,","venue":null,"work_id":"f9883dfa-f55b-450b-8cc8-08fc58b193a0","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.282398Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:643eca188cd5ce0f8975a791176ae19c1ec418bcec0e8e9d05d1e1dc51425ed3","observation_id":"335f9c72-14f9-4d0b-9d3d-7ba3e47b1cba","resolution":{"observed_at":"2026-08-07T14:22:13.348423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:12.945017Z","title":"Dpm-tse: A diffusion probabilistic model for target sound extraction,","venue":null,"work_id":"dbacc139-3a27-4c7d-a0e1-5fbfdd0adbaf","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.286482Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:64c3997c31693b7f5eb679135a0a2e5608f68c6802fd8ea8113fb1e174e757b0","observation_id":"e99c4cc7-f709-4a9a-a5f6-b9cb4bf63e49","resolution":{"observed_at":"2026-08-07T14:22:13.098187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:12.601174Z","title":"Diffusion- based generative speech source separation,","venue":null,"work_id":"d0338579-ee12-4837-9544-e7b0d552e2cc","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.290826Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4e71a0d4de1a18be4c63b7dc21bbf5ac252bfc43b8fefea68bc8cd7819d03357","observation_id":"73ea1afc-061b-4f60-a9f9-019697bca4fb","resolution":{"observed_at":"2026-08-07T14:22:12.750074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16117","last_updated":"2024-09-25T01:21:31Z","snapshot_observed_at":"2026-08-20T05:56:01.994572Z","submitted_at":"2024-09-24T14:24:47Z","title":"Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration","version":2},"cited_work":{"arxiv_id":"2409.16117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16117","snapshot_observed_at":"2026-08-07T14:22:07.679347Z","title":"Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration","venue":"eess.AS","work_id":"d7ed71fd-2bcd-4e72-9c65-062869783632","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.295184Z"},"links":{"cited_paper":"/paper/2409.16117","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e83c23b3e45c9729244e790dea342c56bb7aa5c970c3beeebd528fd8ca6c0bba","observation_id":"246e030c-ca12-4386-8f20-fdd375bd3a4e","resolution":{"observed_at":"2026-08-07T14:22:07.683925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:12.276356Z","title":"Generation- based target speech extraction with speech discretization and vocoder,","venue":null,"work_id":"67ea9df2-63ae-47b2-a58b-f4d79521ad5f","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.299420Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:73c49e376f181a98ebdbce14b8ced1eec00c9e6136bf6cff3ae4cdd239ae5fb5","observation_id":"aa515a27-f2d8-4c0c-99c9-7d5b713dd5b7","resolution":{"observed_at":"2026-08-07T14:22:12.458042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-18T08:09:08.595052Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"cited_work":{"arxiv_id":"2501.14477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14477","snapshot_observed_at":"2026-08-07T14:22:07.662926Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","venue":"eess.AS","work_id":"a5c811a8-63a5-4457-9bd3-49f05fafdaa5","year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.303374Z"},"links":{"cited_paper":"/paper/2501.14477","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:841274d0639dcaaa9930051335b217ff26def2b8e0534482c597f5ad106069af","observation_id":"25dbd4bf-1922-457e-abd1-dd3165775919","resolution":{"observed_at":"2026-08-07T14:22:07.667941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.307054Z","title":"Diffusion-based signal refiner for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.307054Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:14030b2f1e0ab98f8ad93900cd147d9530a479b0994943f2d1a96ece7b84433a","observation_id":"72098b94-b6c8-4c80-a0a5-18864715c414","resolution":{"observed_at":"2026-08-07T14:22:07.307054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:11.871358Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation,","venue":null,"work_id":"72f73e86-eda9-45c5-8eb9-24bc0f0bbe17","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.311336Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8c4f4e2f55e3a5a71b1d309d0a199ec08e8d06219cf35f7d22d09571f2b77fdc","observation_id":"4842be6c-412c-46b7-83ea-3ef0264395a8","resolution":{"observed_at":"2026-08-07T14:22:12.042351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:11.605956Z","title":"Ddtse: Discriminative diffusion model for target speech extraction,","venue":null,"work_id":"4e08f872-663a-42c5-b660-fab571a388b6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.315289Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:b3b15548bcabce3e6fcf660cb1315154a0729bd99007dce42ac3925a0ef20422","observation_id":"22f71e89-d785-415d-b410-649fa43d864b","resolution":{"observed_at":"2026-08-07T14:22:11.826875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:11.076059Z","title":"Speaker-aware neural network based beamformer for speaker extraction in speech mixtures,","venue":null,"work_id":"e44693a0-d3d8-4437-9c2f-28c080e96bc8","year":2017},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.319275Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:41e46356cf219265cdea3388607dae95fbbe74bbc4e65e4789cad9de5ed3a4d5","observation_id":"4c8713c5-9933-4c50-ba86-8f2066bbe735","resolution":{"observed_at":"2026-08-07T14:22:11.286750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:10.568651Z","title":"X- vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":"c3894832-df40-4aeb-af8c-956a7c844ff6","year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.323186Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:5ece419844260df96608799ae364b65946992082965aede07a64c1346c243490","observation_id":"52a51c3a-7be6-4adb-80a6-4269e55219eb","resolution":{"observed_at":"2026-08-07T14:22:10.825851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:10.265384Z","title":"Probing self-supervised learning models with target speech extraction,","venue":null,"work_id":"30e7e4a9-1482-45ef-9e87-babdf30c1fd6","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.326526Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:84ff18fede12396020a31a9f75489e799527d57419cf09f236db8d42ca1b0c67","observation_id":"4f347263-8123-49eb-a228-bd5c259de03c","resolution":{"observed_at":"2026-08-07T14:22:10.383416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:10.102664Z","title":"Target speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"11217e14-b517-4e4e-93fb-e83c0ffe0141","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.329756Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:2379e7413a0eb62fb532d263804de73e080beea43c15c73ff37ae71b798e2622","observation_id":"70347c62-4802-4526-b4b1-884eaeda3a8c","resolution":{"observed_at":"2026-08-07T14:22:10.184130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.974088Z","title":"Smma-net: An audio clue-based target speaker extraction network with spectrogram matching and mutual attention,","venue":null,"work_id":"c40afde8-c81f-4afa-b6d2-a0bc1213cf8e","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.333165Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4f90485504b1606f62ab29ebf3db997b95f6775c67e20a4210c44412908a1cc3","observation_id":"a6131e0a-85aa-4405-8e71-6099872bfdb6","resolution":{"observed_at":"2026-08-07T14:22:10.039313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.827515Z","title":"Target speaker extraction by directly exploiting contextual information in the time-frequency domain,","venue":null,"work_id":"92dd19d2-1c13-4249-93dd-6843c14a3f51","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.336782Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fb3c1d12be4bac87d8555882154b2e2ae9177ee79ac0945db7029d5ef0b9ac74","observation_id":"dc6868b9-d78f-42f0-848f-bb5f43732e07","resolution":{"observed_at":"2026-08-07T14:22:09.902393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.660811Z","title":"Target speaker extraction with ultra-short reference speech by VE-VE framework,","venue":null,"work_id":"74539907-5420-422b-b050-4faab5652689","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.340177Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:634214c2c031414390264a3a4a0015ec5514d84c6900df8df49371afbd6e0b85","observation_id":"f0f6c734-18fe-4623-9839-4327c25098b4","resolution":{"observed_at":"2026-08-07T14:22:09.751317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.493544Z","title":"Sef-net: Speaker embedding free target speaker extraction network,","venue":null,"work_id":"d90229cb-f803-41d4-a681-f77a1b99eff9","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.344503Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a11fe394827ccba2533c33511148676af625f0d9712d69fa13cc48d147132110","observation_id":"cfcbd0d9-aa6b-4853-b2a3-7dd89ec2c885","resolution":{"observed_at":"2026-08-07T14:22:09.585458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.407464Z","title":"Common diffusion noise schedules and sample steps are flawed,","venue":null,"work_id":"52a6f97c-14a0-46e5-a33b-2b2bc39dbc21","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.347592Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:5d4d68cb2c8a6e9acf0d8b04249044f17c1118af99c076eb4c5c5150e3b37341","observation_id":"6dc8bc8b-9d24-4d81-9c76-b40ddc55d071","resolution":{"observed_at":"2026-08-07T14:22:09.460733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.310891Z","title":"Progressive distillation for fast sampling of diffusion models,","venue":null,"work_id":"9584b3de-5904-438e-926b-7a9bda0305d8","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.350993Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:239f98aeb8f30e1ca9e317961803b7bd267d23efad12a345dc4ff297387ae823","observation_id":"23f2da4c-8b3e-435f-ad39-abb56ef48d70","resolution":{"observed_at":"2026-08-07T14:22:09.360479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:09.116192Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"b54b236e-485c-4050-85f7-fcc837f52187","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.354792Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0b8aab995c85d2f84d988ca09c212aea8e07674f666850029798893d8dc363f1","observation_id":"f157c4e6-1f2e-4093-a974-7438ab5c6e9d","resolution":{"observed_at":"2026-08-07T14:22:09.211137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-16T13:32:41.679971Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-07T14:22:07.358306Z","title":"Stable audio open,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.358306Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:af712a05b4dd9636303f95e4b80f89d24f99e4f45e0712713ba1f34c9173b1d4","observation_id":"010a6aa9-89f3-47cb-9fbb-8b2e41a8ab8f","resolution":{"observed_at":"2026-08-07T14:22:07.358306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10819","last_updated":"2025-06-19T04:44:02Z","snapshot_observed_at":"2026-08-17T02:39:04.886528Z","submitted_at":"2024-09-17T01:27:28Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10819","snapshot_observed_at":"2026-08-07T14:22:07.362796Z","title":"Ezaudio: Enhancing text-to-audio generation with efficient diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.362796Z"},"links":{"cited_paper":"/paper/2409.10819","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a1b0c6e53dcd32949d12c3ae50679a5051727659feb59f603439f4dd94173cd0","observation_id":"96e4134f-1562-4fc0-96fe-b16912434989","resolution":{"observed_at":"2026-08-07T14:22:07.362796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.958426Z","title":"Tf- gridnet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":"ba2b616f-8e97-43ce-ac8f-da7126d1f613","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.366834Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:3273202961f2f7edc84c41b307f1657cc35894d67fa97c492c37a9e1b25cec15","observation_id":"15bc5cc7-3c30-4004-a002-2d6a7760ec0b","resolution":{"observed_at":"2026-08-07T14:22:09.018402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02063","last_updated":"2024-09-10T14:02:58Z","snapshot_observed_at":"2026-08-16T14:04:14.953751Z","submitted_at":"2024-04-02T16:04:31Z","title":"SPMamba: State-space model is all you need in speech separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02063","snapshot_observed_at":"2026-08-07T14:22:07.370792Z","title":"Spmamba: State-space model is all you need in speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.370792Z"},"links":{"cited_paper":"/paper/2404.02063","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:40c925fbfa1e2cdf4238e63eec4d9f81e786f87b3f8cb45bb82f7ea729d566e9","observation_id":"e6a27d0f-83b0-47a4-b831-3b0e46ed4003","resolution":{"observed_at":"2026-08-07T14:22:07.370792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.798705Z","title":"Complex ratio masking for monaural speech separation,","venue":null,"work_id":"ca11d8b1-84a3-443d-9bab-043f804b05d3","year":2016},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.374906Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e47af49ac50af1ad7a7acc16b369ff22fd5b6f6053126642bb8c2f50ec58cef1","observation_id":"11054119-9270-47de-9613-91804548ef4b","resolution":{"observed_at":"2026-08-07T14:22:08.871580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.379255Z","title":"auraloss: Audio focused loss functions in pytorch,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.379255Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8def2050a0e056fa0cdeee6fe81e7a22df19c80b84c5acc39447ed3663d552c9","observation_id":"aadc30e0-17e9-4e6e-ba89-151dfc7f0c01","resolution":{"observed_at":"2026-08-07T14:22:07.379255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.570576Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"5d08e12e-9fb3-40d7-bf08-68379ee21b2a","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.383128Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4acacc7f0716d877f34d4046d773c31780da2d20a585aa809cda756473da82a6","observation_id":"54a7bc8f-5781-4c69-b7e1-ad5fe4ce80f4","resolution":{"observed_at":"2026-08-07T14:22:08.674926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.350463Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"8fd66ec4-96d8-4f88-b9ea-4b0ced4df7d2","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.387236Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:bd818bc42c50245c0289e7743a691715ee1fe2b43f64be81e02a9d0543930a3a","observation_id":"de2e9680-5b1a-41a2-9c2f-441ef16b5157","resolution":{"observed_at":"2026-08-07T14:22:08.454405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.228100Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"8828561f-045d-4edb-b676-88c9633cd30a","year":2021},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.390920Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:bdd9b2dd9ab4a16240ca071c0bdd6e0391884c22ea52ce74444131c7e9a0cdc9","observation_id":"31cfd854-1be9-4e3c-804e-60f026a25267","resolution":{"observed_at":"2026-08-07T14:22:08.264101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.395030Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.395030Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:6b3c6474d11b48fb38d6b287c18f3e48dec677d9ef2ce7a73124314db70d118c","observation_id":"a0bfd558-bae4-425f-91e7-49c5aed8eebf","resolution":{"observed_at":"2026-08-07T14:22:07.395030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.074184Z","title":"Roformer: Enhanced transformer with rotary position embedding,","venue":null,"work_id":"f9cb18ff-2292-415e-ac73-df467e05467a","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.399020Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:a9e35a83c8766d3177d23afaf78102d16443567945150d2398bdaadd44930cc8","observation_id":"2f748628-177d-4a38-b1bd-f2f82efc59c0","resolution":{"observed_at":"2026-08-07T14:22:08.143124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.036627Z","title":"Single- channel multi-speaker separation using deep clustering,","venue":null,"work_id":"7b7534b4-1a3f-43a7-996f-01313a5672a7","year":2016},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.402914Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:8d2579f407e7d44f385aa53f9d114379b391dee67a64cad2ef297d7c7b401dad","observation_id":"0edd31f9-8f3b-4bb4-9518-44c1cbd8072d","resolution":{"observed_at":"2026-08-07T14:22:08.040444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.024873Z","title":"Conv-tasnet: Surpassing ideal time-frequency magnitude masking for speech separation,","venue":null,"work_id":"d801100b-7d27-42ce-a89e-4a860bddd2ba","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.406508Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:0b897cb7271f65ad0532629b29d9f1d9c23d357e4903cca1f80d68202c004520","observation_id":"75bdcf37-727d-4132-8a8d-0786387e5952","resolution":{"observed_at":"2026-08-07T14:22:08.028706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.012838Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":"91552f88-a99b-4178-8c82-d2bb06d36e8e","year":2019},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.410086Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:db98fe796059e4646b373a822516e8c4f526add5bb7d5932c56472cae44be30e","observation_id":"4918245f-567b-4278-be56-986fac214ce5","resolution":{"observed_at":"2026-08-07T14:22:08.017035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:08.001558Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"88b45c7a-a362-47d4-995a-72e74766842d","year":2015},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.413724Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:c61bc3741085d7a9e34971ee33cc8193454901a6e203f025b3bdc3f59f6ba83b","observation_id":"79627c97-0cab-4265-9437-c08bde14e8bb","resolution":{"observed_at":"2026-08-07T14:22:08.005422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.987914Z","title":"Improving speaker discrimination of target speech extraction with time-domain speakerbeam,","venue":null,"work_id":"665864a4-e3e5-4a63-9f9f-34f16a620648","year":2020},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.417535Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:25898afda66bd470c09a6ed6db8f38cadba6fa1edff96093e1660e20f3d284f2","observation_id":"73d7aa18-fb73-4828-97c6-8dd42e67a898","resolution":{"observed_at":"2026-08-07T14:22:07.993118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-18T07:31:38.105834Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-07T14:22:07.421318Z","title":"MUSAN: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.421318Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4db3021fa69214cb9392805c9e3f164709ebb07517621fb88a077e99d6dda60e","observation_id":"7deb9100-49d1-4a44-81eb-7d1dac4d1144","resolution":{"observed_at":"2026-08-07T14:22:07.421318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.975318Z","title":"Multichannel audio database in various acoustic environments,","venue":null,"work_id":"e7f95162-a3e6-4fd6-b4f8-38c7181878e9","year":2014},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.425128Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fcb8146ad34722b521565f6b3d7acd12ed829be92ae2690d691eb2e718c06566","observation_id":"d5dd377b-9cfe-4767-b06e-9e8dc831bfbf","resolution":{"observed_at":"2026-08-07T14:22:07.979644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.961050Z","title":"The fifth ’chime’ speech separation and recognition challenge: Dataset, task and baselines,","venue":null,"work_id":"6c1e098c-f012-4f74-b436-2c7194c2f698","year":2018},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.429542Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:51e6c1629ba16e1431c3ffcb137b12cbc8ca8f59a82f2a126c6265d9d60d7f1a","observation_id":"6be34bc1-4554-44a6-bbce-60ee64db0d1c","resolution":{"observed_at":"2026-08-07T14:22:07.966005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01481","last_updated":"2025-03-06T04:11:26Z","snapshot_observed_at":"2026-08-18T04:21:26.975351Z","submitted_at":"2024-10-02T12:33:59Z","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01481","snapshot_observed_at":"2026-08-07T14:22:07.433411Z","title":"Sonicsim: A customizable simulation platform for speech processing in moving sound source scenarios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.433411Z"},"links":{"cited_paper":"/paper/2410.01481","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:02ff2e5af0e3c4e5e5040bd64143b6c04d07d3da2aaae0ede66f9fd750743055","observation_id":"b89ca30e-01c2-46bf-b953-d0904c8f36e3","resolution":{"observed_at":"2026-08-07T14:22:07.433411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.943194Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"fcbc2c7c-c25d-452a-973f-feb6611e31ff","year":2001},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.437013Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:4a21012dba6d5b9dbb027d6931f02c9b09057c0bd875ab28f56313746a7e195e","observation_id":"35abf0fb-854c-4bf8-ae44-0209e167cd0d","resolution":{"observed_at":"2026-08-07T14:22:07.951031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.924483Z","title":"An algorithm for predicting the intelligibility of speech masked by modulated noise maskers,","venue":null,"work_id":"0d5d72c4-f881-4cdf-b852-376a1b54cc3a","year":2009},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.440926Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:fb3375bc244432f050ee1a8bedbc04ddf47e02039fed570fb3467c86a6256f32","observation_id":"e24fe973-e9ee-44e8-88a7-9561bd4b5938","resolution":{"observed_at":"2026-08-07T14:22:07.931359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.902732Z","title":"Dnsmos P.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"74e93a66-d80e-4a4c-9b89-b5f1f5e6c97d","year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.445060Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:741a30f4fc1f9bc5df2fe2b99570c9877f775a8ad4ac94afde531049389fb74e","observation_id":"9ca04559-6a14-4eb9-95b6-5a04d202f30a","resolution":{"observed_at":"2026-08-07T14:22:07.911881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.883872Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"7c7c84a2-bd76-45af-b154-a60f47351155","year":2023},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.453503Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:f15446fb1d22187f4aeba7513a8c2df24a66a42e4a646e33ac39a286ca5a3deb","observation_id":"a04353fe-156d-442a-ba94-d5b2718ed1be","resolution":{"observed_at":"2026-08-07T14:22:07.888087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.457443Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.457443Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:51486c57a12c9f768ab80821fe16a046a40263977c40ad239d9dbc992ada5b6f","observation_id":"7f382b3e-dce3-42ac-8325-5ba18d26efb8","resolution":{"observed_at":"2026-08-07T14:22:07.457443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16126","last_updated":"2024-08-28T20:26:34Z","snapshot_observed_at":"2026-08-20T05:55:45.092146Z","submitted_at":"2024-08-28T20:26:34Z","title":"Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation","version":1},"cited_work":{"arxiv_id":"2408.16126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.16126","snapshot_observed_at":"2026-08-07T14:22:07.526652Z","title":"Improving Generalization of Speech Separation in Real-World Scenarios: Strategies in Simulation, Optimization, and Evaluation","venue":"cs.SD","work_id":"408f827a-8617-4f08-b3bd-d37c512a778e","year":2024},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.460985Z"},"links":{"cited_paper":"/paper/2408.16126","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:ec50804b5df3146e7d080ae3b9d567175c94b4b955b51d265d58c5640f813410","observation_id":"e5c1acbc-6245-400f-8509-f8751ee5b120","resolution":{"observed_at":"2026-08-07T14:22:07.533270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:22:07.466008Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.466008Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:cdc75896a7312c74cae186ef92e1eb1bf67dd9ef19cb455ccae52be45ad923e3","observation_id":"31812576-3bd2-4f26-836a-81dda307c00c","resolution":{"observed_at":"2026-08-07T14:22:07.466008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.865629Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":"4755ad06-888f-4844-8245-620e6b8c5ae3","year":null},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.470504Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:57ca5b273cd2203d65aaebec2dcbf4059c13daedec3f18114236d73318f60b81","observation_id":"2da558ad-64b7-47c4-b910-1665ea66ae00","resolution":{"observed_at":"2026-08-07T14:22:07.869297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.852499Z","title":"Available: https://openreview.net/forum?id=08Yk-n5l2Al","venue":null,"work_id":"15ed2535-8b10-4ebd-820a-3a448a62a776","year":null},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.475291Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:7d01e4682149a169adcc9eae579c062d62ca62bd7fd8fa1c751f65f2ece41904","observation_id":"6f599b9a-c3e8-4b82-9d3d-e8ebea2852e9","resolution":{"observed_at":"2026-08-07T14:22:07.857925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:22:07.449434Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.449434Z"},"links":{"citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:b19675f18e909745f975997ac809299954c40b20b6a632dc22d3c41502553aaa","observation_id":"f9ec7a85-4eca-4bf2-b7a6-cc964b864693","resolution":{"observed_at":"2026-08-07T14:22:07.449434Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T21:46:14.592221Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":17,"verified_exact":7,"verified_fuzzy":55},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 3 inbound Pith citation observations for arXiv:2505.19314."}