{"as_of":"2026-08-18T22:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:371fb8d05134f73697815131304e19530bc96012301951ed6417cf220e49a8fc","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:55:33.743598Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15198/citation-record","integrity":"/paper/2607.15198/integrity","json":"/paper/2607.15198/citation-record.json","paper":"/paper/2607.15198"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:29.502928Z","title":"V oiceFilter: Targeted voice separation by speaker-conditioned spectrogram masking,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.502928Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:6263289cbe96ebf5930341165ac72897d3a1095c16de03da51ae670c23aba000","observation_id":"e7d322e0-9319-497d-81ee-a9962f84c3b6","resolution":{"observed_at":"2026-08-01T23:55:29.502928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:29.612146Z","title":"SpEx: Multi-scale time domain speaker extraction network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.612146Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:3fb1cae32bd929d77e1d0083b496fe62c8a02f87ef6c91559582aed4e59a27e0","observation_id":"6c3cebdd-84e3-4c6b-9d4b-a57ff60b207e","resolution":{"observed_at":"2026-08-01T23:55:29.612146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:29.779647Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.779647Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:7f62770d0f012b44bbb84959f33c4ea0f4822a467b5d4cddbc67aad2aded7370","observation_id":"85fc6d9a-561e-4aa5-a523-d304745df503","resolution":{"observed_at":"2026-08-01T23:55:29.779647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-01T23:55:29.954391Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:29.954391Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:257b31ce24376d518d8ba7160fd032efa270c8528e05bc6ed6b76662b3582e5b","observation_id":"069e1799-3731-4254-ac16-51700c65bbc3","resolution":{"observed_at":"2026-08-01T23:55:29.954391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.129251Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.129251Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:195e9ace74872a1d598dac4c070bd5b3592816424b582c503b1cf033ebb8510b","observation_id":"d4dbae8e-c24d-479f-8f21-e6a2e6dc16fe","resolution":{"observed_at":"2026-08-01T23:55:30.129251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.341452Z","title":"The Fifth ’CHiME’ Speech Separation and Recognition Challenge: Dataset, Task and Baselines,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.341452Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:7577deddb900e646249c90b100e225db60db2f31f9b9e72170b9b153624c671f","observation_id":"e780a627-4a1c-4fc0-935a-9c112ac0dc33","resolution":{"observed_at":"2026-08-01T23:55:30.341452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.475244Z","title":"CHiME-6 Challenge: Tackling Multispeaker Speech Recognition for Unsegmented Recordings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.475244Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:39e967625741131d75c4577581f29f907df6713fc1b30ead529955d332942fe7","observation_id":"1bb94c4c-e378-4eaf-9c7a-37dbb1e1ac89","resolution":{"observed_at":"2026-08-01T23:55:30.475244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.604031Z","title":"Descriptor: Enhancing conversations for the hearing impaired in the 9th computational hearing in multisource environments challenge (CHiME9 ECHI),","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.604031Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:b52217c670860e1546afc9e003cb60bfc8e068a97d9ca395a35584ba2448dd48","observation_id":"59576c93-bbd0-4d1e-9dad-72bec9de4d80","resolution":{"observed_at":"2026-08-01T23:55:30.604031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.724559Z","title":"M2MeT: The ICASSP 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.724559Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:cfca6e786241f7012208a6002899d9827f6a92e56b74463d1172788f1aa756fb","observation_id":"1653f923-83f4-4bfb-9b6e-048b3eed7de3","resolution":{"observed_at":"2026-08-01T23:55:30.724559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:30.845696Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:30.845696Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:b2ce304cce550e147a860e6cfc8d0e557427b67f71dc48c0c14cf93cf9db670a","observation_id":"aad57061-785f-4178-8b66-a4eb540f76ca","resolution":{"observed_at":"2026-08-01T23:55:30.845696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.011467Z","title":"REAL-T: Real Conversational Mixtures for Target Speaker Extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.011467Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:7c0bc4dd10142527801169311e4b9ddeacd6f386d2a989fe96bbb72b2b87f439","observation_id":"14798e87-7106-4347-8b4b-b058d496fc40","resolution":{"observed_at":"2026-08-01T23:55:31.011467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.128677Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.128677Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:f51a665b8422c3f783e07ab5de30043d3ea6f7833458e2ba1c2d4bb4b14b415c","observation_id":"5838dfee-e73c-4258-8624-3ffd9d262e23","resolution":{"observed_at":"2026-08-01T23:55:31.128677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.226364Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.226364Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:cf54c976472cbad2d151ef34c68c46490fdca6d14acfa793731d3d4d2241c723","observation_id":"26759e63-6c94-4f0f-bf33-bed2262ca686","resolution":{"observed_at":"2026-08-01T23:55:31.226364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.344791Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.344791Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d2dde7254abfc21380030ff5076b7c2b9536a04d252f73c563d74769f3e02616","observation_id":"90d1402b-a338-48c0-b415-2c28127159ea","resolution":{"observed_at":"2026-08-01T23:55:31.344791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.412772Z","title":"DNSMOS P.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.412772Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:5a941ab79ac5d813bd5869394ed2f050dc0cbf3898356daea6b3db77d48930ef","observation_id":"148d4467-1d52-4b80-8500-4b4303b6155f","resolution":{"observed_at":"2026-08-01T23:55:31.412772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.473472Z","title":"DNSMOS: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.473472Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:b2449db651a0863aae867cb0082d2b4d565545d27b69c42305494a35f1ce7b4e","observation_id":"07c6eb75-3d97-4018-865b-0455f7c057f2","resolution":{"observed_at":"2026-08-01T23:55:31.473472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.568792Z","title":"Fireredasr2s: A state-of-the-art industrial-grade all-in-one automatic speech recognition system,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.568792Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:6d2272fa6d55b876554b9395dbbe9ccbe479bec1c03fc05043bfe83f31dd11ee","observation_id":"edf25c10-fafb-4aae-80b6-0d6b31659444","resolution":{"observed_at":"2026-08-01T23:55:31.568792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.629281Z","title":"Image method for efficiently simulating small-room acoustics,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.629281Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:a49231f0e8925651f5fcc20e1f0392f9cde5c49296f3619c2c9424720e5a3096","observation_id":"190e11fb-b69e-4c25-be4e-a398e20bf34a","resolution":{"observed_at":"2026-08-01T23:55:31.629281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.721756Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.721756Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:ab95ccb7a73405343d7f761bc47d6691b171bac284fc67e6fe8d9c9cfd5efe3b","observation_id":"ec0b618d-79ec-40eb-99c0-33c7bd5904a4","resolution":{"observed_at":"2026-08-01T23:55:31.721756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.817101Z","title":"DiPCo – Dinner Party Corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.817101Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:615ceb7cd5de9877c53d6bbcd42be4f4b50c6100148b609dbdd5eed56a8e96d5","observation_id":"a5a7209c-cb4b-41d5-ba19-becaf98a87ab","resolution":{"observed_at":"2026-08-01T23:55:31.817101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:31.913671Z","title":"Music source separation with band-split RNN,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:31.913671Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:3918c09fca05d4b5eff72e72f69fd2eca36647c6ee9e5f6ee43b2e2f27384a8a","observation_id":"6065f502-0b4a-4f35-801c-99b2eb9ef931","resolution":{"observed_at":"2026-08-01T23:55:31.913671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.004568Z","title":"Multi-level speaker representation for target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.004568Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d8f1e49d626e002f21a2df477eb013555bea7523181473cdd0daa9dbe5159f49","observation_id":"17af6bba-510c-4b10-b23d-70938d9a3a12","resolution":{"observed_at":"2026-08-01T23:55:32.004568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.096524Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.096524Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:79686f986101957ee252e0ed85b1e8271a71e1bf4b921d490077e7803ffbd07a","observation_id":"cc0bd727-ffd1-48f2-8897-587d3aef4348","resolution":{"observed_at":"2026-08-01T23:55:32.096524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.190697Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.190697Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:28d3fcffce2261e84295b57a6754f92e682dd0e13b450106319e85e43d9ed7ea","observation_id":"4092e76c-37dd-40df-b88a-455124d3285a","resolution":{"observed_at":"2026-08-01T23:55:32.190697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.252100Z","title":"V oxceleb: A large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.252100Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:81381aa8aa805780a06ccbb80223e2f0f2ca8c84c9f127281f8ed2183d6d4c17","observation_id":"20688441-8a8b-44e2-a978-56e198c428c2","resolution":{"observed_at":"2026-08-01T23:55:32.252100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.349907Z","title":"CN-Celeb: A challenging chinese speaker recognition dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.349907Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:53a49d98faa0118fb74271248645f60b2c780f1d2d6a5eace3de06562fe2d837","observation_id":"8591ae37-2507-4c98-a3c5-dc4093e07511","resolution":{"observed_at":"2026-08-01T23:55:32.349907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.418267Z","title":"Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.418267Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:968ad16ff6c900298c62daed44ad2fc95b025a50433ab6dc09798e05c8fcafa4","observation_id":"281449cd-fde4-4c6a-8744-1b4cf4fe03dc","resolution":{"observed_at":"2026-08-01T23:55:32.418267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.537436Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.537436Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:34332b1250338a7d8c5e5faa3af0daec88279785b68ec5611a2ea1a50240f392","observation_id":"5e3370d0-0cf2-4a3f-998d-beebee452ebd","resolution":{"observed_at":"2026-08-01T23:55:32.537436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.603764Z","title":"EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.603764Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d58317b6c437b8424137140abf26232c002dc4c3a1bae48a54a8f657c7f10fe2","observation_id":"e7f828df-2080-4458-898d-42c3b89ca208","resolution":{"observed_at":"2026-08-01T23:55:32.603764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.715991Z","title":"WHAM!: Extending Speech Separation to Noisy Environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.715991Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:c52d15fdc34f3f12882a0d1015ec0653679fa34fab255b4a9f3a945c4276d451","observation_id":"f5e1aac2-5398-4665-9b9b-a0a8b640fd17","resolution":{"observed_at":"2026-08-01T23:55:32.715991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-18T07:31:38.105834Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-01T23:55:32.787563Z","title":"Musan: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.787563Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:890b6f410bb883e8d1448d3bc87f3e7c6f19c5151eb229a8238330e9dec8b54e","observation_id":"32ad0a4e-59ca-4768-873c-410ea463340a","resolution":{"observed_at":"2026-08-01T23:55:32.787563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.883765Z","title":"DEMAND: A collection of multi- channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.883765Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:c844c1841d8d016aa389bf7c8e5df786a7350635690958ca2ad25eea452a4830","observation_id":"2dfe1e0c-70d1-4cb5-8c87-40db1153e645","resolution":{"observed_at":"2026-08-01T23:55:32.883765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:32.981307Z","title":"The INTERSPEECH 2020 Deep Noise Suppression Challenge: Datasets, Subjective Testing Framework, and Challenge Results,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:32.981307Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:2996bcd720fa3b09c12456d4af0d6c7043ddc3d53d4943cbfaf6071fce5ae7c2","observation_id":"b44bb0f2-0330-4562-b049-f13ae9308a81","resolution":{"observed_at":"2026-08-01T23:55:32.981307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.111260Z","title":"Building and evaluation of a real room impulse response dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.111260Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:8787dd53a0e41ee0d419ac8d3092e4ed5b7f52684206bd559a332155c288e067","observation_id":"f32a0238-ee59-47b1-b91a-5f6708b50b08","resolution":{"observed_at":"2026-08-01T23:55:33.111260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.229214Z","title":"Fast random approximation of multi-channel room impulse response,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.229214Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:bf5818516658cc52ca8a92f2954fc3cf2134e742b06f6937d8e7bb8f84245aa8","observation_id":"5935f448-6ff7-48da-adca-efe214816240","resolution":{"observed_at":"2026-08-01T23:55:33.229214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.345978Z","title":"TF- GridNet: Integrating full-and sub-band modeling for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.345978Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:6fef0cddb4fdf8c7a9b8c5fbdc304c54dcc8c496c7f03a43437a4812118795c7","observation_id":"4af715b9-c5e6-480a-8b56-5b562d383461","resolution":{"observed_at":"2026-08-01T23:55:33.345978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.397361Z","title":"Notes on the history of correlation,","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.397361Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:d8ad77f7cc12af10a2e0f87f911fbecbbe07e88fd59a64b7989c4da78570c057","observation_id":"1498298a-a1cc-4c8c-93c0-18a4058c2f64","resolution":{"observed_at":"2026-08-01T23:55:33.397361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.490785Z","title":"The proof and measurement of association between two things","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.490785Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:dc1ee0e9131c4f52e689814a49cd644c2578213abf980b1acec10051ed62d9da","observation_id":"ea63e4ae-e748-4146-87bc-5000313d07cc","resolution":{"observed_at":"2026-08-01T23:55:33.490785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:55:33.743598Z","title":"DNSMOS Pro: A reduced-size DNN for probabilistic MOS of speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:55:33.743598Z"},"links":{"citing_paper":"/paper/2607.15198"},"observation_digest":"sha256:aa08231050257b31411835b093dc01ec7c7c827182bceca21f88864fee06b2fc","observation_id":"c87d1c48-f2df-4a31-91c3-770a881bd309","resolution":{"observed_at":"2026-08-01T23:55:33.743598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15198","last_updated":"2026-07-16T16:57:05Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T22:09:08.429770Z","submitted_at":"2026-07-16T16:57:05Z","title":"SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.15198."}