{"as_of":"2026-08-11T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b5331c8384f5895373c0692af25b0a2ca64234b6071e243ec191a3218b57217","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:06:36.061223Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08191/citation-record","integrity":"/paper/2502.08191/integrity","json":"/paper/2502.08191/citation-record.json","paper":"/paper/2502.08191"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:35.923599Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.923599Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:05af6c9bcb5215279793da9308bf7669a4eb114d33e3a55a265315c4adc61712","observation_id":"3747b99a-2b8c-4218-974f-f3bf502692f7","resolution":{"observed_at":"2026-08-08T10:06:35.923599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.566769Z","title":"The cocktail party phenomenon revisited: The importance of working memory capacity,","venue":null,"work_id":"a6e69769-fc49-48ee-912f-6ca068dbc17c","year":2001},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.928089Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:5bcd5a4bba3d7f5f5347085ce445240f089279dc09196f2d9d47f2cdea1c9866","observation_id":"089cb7e3-f9e3-4167-9c3a-f6ab29ef4689","resolution":{"observed_at":"2026-08-08T10:06:36.571334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.552226Z","title":"An event-related potential study of selective auditory attention in children and adults,","venue":null,"work_id":"33b33125-c685-48e0-bc03-8578dc31bdde","year":2005},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.932253Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:ebffc60e2c34bb0360824c79acc1ba4b96a4997091f45630f99a297f3574c90f","observation_id":"2bea3240-35d6-4ad0-8511-c50204933188","resolution":{"observed_at":"2026-08-08T10:06:36.556553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.538944Z","title":"Selective cortical representation of attended speaker in multi-talker speech perception,","venue":null,"work_id":"e24c4fa0-7ba5-4f00-b069-cbebae290b97","year":2012},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.937068Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:95e51ea308de06b12196512c768e344ac4944cad2648b84b681d9846be270641","observation_id":"5857d84c-5ee4-4e63-abce-94cf6a016643","resolution":{"observed_at":"2026-08-08T10:06:36.543202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:35.941317Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.941317Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:97ea588838772e3568882462b857077a3124b2bbf062ab3483d34b7bdb200416","observation_id":"2e61c42f-8f5d-4c2d-a605-fcd7010b3ed8","resolution":{"observed_at":"2026-08-08T10:06:35.941317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.516183Z","title":"Dual-path rnn: efficient long sequence modeling for time-domain single- channel speech separation,","venue":null,"work_id":"a0fd29a0-914e-4321-ac77-d3e79a553387","year":2020},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.946093Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:8a35cd979e30a01fd9228ef822277c632d4ec7cdbd9b5fcc88f38f7c3f0d8473","observation_id":"eef047c9-031f-447f-88bf-8363d0e36557","resolution":{"observed_at":"2026-08-08T10:06:36.520393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13975","last_updated":"2020-08-14T10:52:10Z","snapshot_observed_at":"2026-08-04T07:43:16.656810Z","submitted_at":"2020-07-28T03:51:28Z","title":"Dual-Path Transformer Network: Direct Context-Aware Modeling for End-to-End Monaural Speech Separation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.13975","snapshot_observed_at":"2026-08-08T10:06:35.950643Z","title":"Dual-path transformer network: Direct context-aware modeling for end-to-end monaural speech separation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.950643Z"},"links":{"cited_paper":"/paper/2007.13975","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:724fa26d96cbac08a373d51c77cf6c821bd0c9a0030f272d6d9d47fd80422093","observation_id":"c6eeedb6-77db-4bcb-9040-bc30aa612f7f","resolution":{"observed_at":"2026-08-08T10:06:35.950643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.503058Z","title":"Tf-gridnet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":"1acfb708-821d-4a4d-8932-d7cfefa96d19","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.955445Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:0807ff7b888f651a0605099abb663b63f64b3c1a23e515bdc1ec412e2de54400","observation_id":"92dc1bb7-45be-4719-9d83-723f08d71608","resolution":{"observed_at":"2026-08-08T10:06:36.507409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03411","last_updated":"2024-03-06T02:39:21Z","snapshot_observed_at":"2026-08-10T10:32:58.326971Z","submitted_at":"2024-03-06T02:39:21Z","title":"CrossNet: Leveraging Global, Cross-Band, Narrow-Band, and Positional Encoding for Single- and Multi-Channel Speaker Separation","version":1},"cited_work":{"arxiv_id":"2403.03411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.03411","snapshot_observed_at":"2026-08-08T10:06:36.184451Z","title":"CrossNet: Leveraging Global, Cross-Band, Narrow-Band, and Positional Encoding for Single- and Multi-Channel Speaker Separation","venue":"cs.SD","work_id":"22d08bd4-2fb4-4e3d-b539-94cbae4924d8","year":2024},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.959087Z"},"links":{"cited_paper":"/paper/2403.03411","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:6c87c7eebddef5bd3307f11720cd9e4bbce30db7e75de7084e3a68b679ffdd7d","observation_id":"221bdceb-83a8-44c7-a5f5-b735fd482ccb","resolution":{"observed_at":"2026-08-08T10:06:36.189043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.489130Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"8b9929c9-ce2f-4f1b-8ec1-5bf0ae97b13e","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.963133Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:39214fbae7f7cbafe26230eaef35d6cc7c7e2bc1cd50b2bc35060088afa54cd4","observation_id":"b94022f0-c4fe-48e1-8e4b-33f3e08fa950","resolution":{"observed_at":"2026-08-08T10:06:36.493809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04826","last_updated":"2019-06-19T17:10:51Z","snapshot_observed_at":"2026-08-02T02:00:03.822386Z","submitted_at":"2018-10-11T02:57:14Z","title":"VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04826","snapshot_observed_at":"2026-08-08T10:06:35.967023Z","title":"V oicefilter: Targeted voice separation by speaker-conditioned spectro- gram masking,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.967023Z"},"links":{"cited_paper":"/paper/1810.04826","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:154bdc2348bb8ba26ea4cced76086ff019406262b8679e1e4e0b538632afe7bb","observation_id":"2210c1a4-6f72-4a10-a827-355990ffd65a","resolution":{"observed_at":"2026-08-08T10:06:35.967023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.476089Z","title":"Time-domain speaker extraction network,","venue":null,"work_id":"5bde0b15-5c1d-49db-93da-ae384dc3f366","year":2019},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.971084Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:f71090647406a1768d32e4b89aa5bc70cc849e1ea01fca8f44346e91fea675c6","observation_id":"48c25eb6-4f8b-47b3-b2fb-195fdaa8e166","resolution":{"observed_at":"2026-08-08T10:06:36.480225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.463467Z","title":"Spex: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"ce50554a-b974-4065-81b0-f451c93fdfd2","year":2020},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.975088Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:2f51df0d689a1bd32151f52a79b4ed1f7dc56886b1e68463b3a1304b1b68cf3e","observation_id":"6651f7ab-cec5-42a8-b726-e770ba0fb542","resolution":{"observed_at":"2026-08-08T10:06:36.467488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04686","last_updated":"2020-08-18T03:03:01Z","snapshot_observed_at":"2026-08-10T11:50:41.077369Z","submitted_at":"2020-05-10T15:00:07Z","title":"SpEx+: A Complete Time Domain Speaker Extraction Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04686","snapshot_observed_at":"2026-08-08T10:06:35.978757Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.978757Z"},"links":{"cited_paper":"/paper/2005.04686","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:e65b25cff8de13f673aca9c73e91ebf2207e7ab0ca01a5059cf6b94cb6eb9955","observation_id":"6b72a265-deb3-4807-b0da-30af340934d6","resolution":{"observed_at":"2026-08-08T10:06:35.978757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.450204Z","title":"Adaptive-spex: Local and global perceptual modeling with speaker adaptation for target speaker extraction,","venue":null,"work_id":"1e47dcb5-5ec0-4cdd-9c54-9c1d888600ba","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.982669Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:3528c1960ff489ac2e64e552374db6942c263d0ef80b26415e93e1a8a762f84d","observation_id":"c9959fb2-8b07-40a2-adbd-4e8b258d9cac","resolution":{"observed_at":"2026-08-08T10:06:36.454231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.436861Z","title":"Multi-stage speaker extraction with utterance and frame-level reference signals,","venue":null,"work_id":"3d4593ea-dc65-4aa4-b6e5-cfb15c312956","year":2021},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.986358Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:359177a71742d1e2bf1917af77e549532dd701b8937c5ad7a5c7b53f8a5d4f3c","observation_id":"4682cbad-a6bd-4abd-a463-b0d7ff93328a","resolution":{"observed_at":"2026-08-08T10:06:36.441070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.423736Z","title":"Neural speaker extraction with speaker-speech cross-attention network","venue":null,"work_id":"75541204-4ea7-4598-af8d-b980e1f51a04","year":2021},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.990204Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:5a5a6863dbd86f34e1d2aec3d1f67ec6bad19d3e61215e51a080514c440ae129","observation_id":"57a39665-19a3-422c-8372-87685bc5b386","resolution":{"observed_at":"2026-08-08T10:06:36.427846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.02102","last_updated":"2022-08-11T08:55:11Z","snapshot_observed_at":"2026-08-08T02:08:29.706273Z","submitted_at":"2020-11-04T02:45:21Z","title":"Robust Speaker Extraction Network Based on Iterative Refined Adaptation","version":2},"cited_work":{"arxiv_id":"2011.02102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.02102","snapshot_observed_at":"2026-08-08T10:06:36.135930Z","title":"Robust Speaker Extraction Network Based on Iterative Refined Adaptation","venue":"eess.AS","work_id":"3ef78b0b-167c-499e-816b-5768a466140b","year":2020},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.993768Z"},"links":{"cited_paper":"/paper/2011.02102","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:e097ae268c72ce83ece2ed1d6bdd7c4ebe1c778a71d32cd910805f46dc30eabb","observation_id":"1e563c58-4a7d-4181-b7a9-78217b2db8e5","resolution":{"observed_at":"2026-08-08T10:06:36.140824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.410260Z","title":"Target speaker extraction with ultra-short reference speech by ve-ve framework,","venue":null,"work_id":"56beeb3f-8eda-4a21-a74b-ba478a2e26d4","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:35.997632Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:f68d220e0dc89ec8e929d1afefeb9266b4e987e59e37f997e34baeb87a965d0c","observation_id":"0ace271d-d7ea-45ab-8126-78bae64fccb3","resolution":{"observed_at":"2026-08-08T10:06:36.414639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.396541Z","title":"X-sepformer: End-to-end speaker extraction network with explicit optimization on speaker confusion,","venue":null,"work_id":"4b14aee6-b31b-4a66-8ae5-eb4edd648419","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.001194Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:af3ccdf4413e19ef28887f74c33c20ec6f837b3239b4e3e558b157c20f270159","observation_id":"2cb27952-e0e2-48a1-b9ac-741ab2cd8a21","resolution":{"observed_at":"2026-08-08T10:06:36.400779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.382983Z","title":"Target speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"c6030801-e25d-4c27-b6dd-2a7d53bfcaee","year":2024},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.005004Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:fdf186492d0edaba52dd11ba1f781d4f5a2f5b1ab898100c55dc6e8585b7d7eb","observation_id":"1bc63093-491e-4ee0-90c1-082d190792a7","resolution":{"observed_at":"2026-08-08T10:06:36.387373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.367986Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"f37c7db8-da0c-4b25-b3a2-5bcd43669db2","year":2019},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.008561Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:5faa33ecf29508dbc56e27335ff12075c59ec8e58110f7fd3d0e13295993049d","observation_id":"49c8b380-dd29-4ecb-b1eb-3cadf93c1fc4","resolution":{"observed_at":"2026-08-08T10:06:36.372641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.352466Z","title":"X-tf-gridnet: A time–frequency domain target speaker extraction network with adaptive speaker embedding fusion,","venue":null,"work_id":"539b7a72-46ab-4ad9-88c4-9b8d3cca29f4","year":2024},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.012214Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:d03ea6741a23173fa7de92723700a268106cfc8f8068353dbaeb13705a283374","observation_id":"437363be-9fa3-4d84-9def-bbffade4d16b","resolution":{"observed_at":"2026-08-08T10:06:36.357442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.338661Z","title":"Single-channel speech extraction using speaker inventory and attention network,","venue":null,"work_id":"3b376d5f-7570-46e7-aa4d-2c5d16618c25","year":2019},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.015841Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:43c3137968f826218b2f07b2929cfd3a70eca7dd8f93370f4997840284e2b055","observation_id":"008e86cc-b5c9-4fb0-a838-e68530ce945e","resolution":{"observed_at":"2026-08-08T10:06:36.342905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.324928Z","title":"Sef-net: Speaker embedding free target speaker extraction network,","venue":null,"work_id":"7453fb6c-4dc3-4c08-b248-48a79507ee0b","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.019330Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:05fd30a16dab6b4ee2ad890001d28d99da0ad4e4bd10f6956f0006acbe12fa23","observation_id":"0348d1ef-8c9e-472a-8489-c33df89c7751","resolution":{"observed_at":"2026-08-08T10:06:36.329135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.311784Z","title":"Target speaker extraction by directly exploiting contextual information in the time-frequency domain,","venue":null,"work_id":"c06361c6-05a6-4aaa-97df-464d92b9552f","year":2024},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.023295Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:36af6ae3dbcad2024e700e388f07f3f96b0557641a0df1b0a45660aced7a6551","observation_id":"cf045db9-2cf4-43e4-8829-9899f3e07ab9","resolution":{"observed_at":"2026-08-08T10:06:36.316022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.297979Z","title":"On the importance of power compression and phase estimation in monaural speech dereverberation,","venue":null,"work_id":"abcabf7c-f9af-4dcb-863f-75f4321af663","year":2021},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.026941Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:f74aa17e75a5d946c4e42b4ee4a716763b2a6038c80bb86d21f105045e9ec3f5","observation_id":"8450e850-d73e-4009-bd77-31f799426d3b","resolution":{"observed_at":"2026-08-08T10:06:36.302169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.030834Z","title":"Root mean square layer normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.030834Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:66e2477f59be4e0e016a5dd97f49e9c4eef27eccc6bf9bdfe0844f62db836581","observation_id":"3d76b5a3-25e9-42c8-b7a8-6ea956d8929b","resolution":{"observed_at":"2026-08-08T10:06:36.030834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.275189Z","title":"Single image reflection separation via component synergy,","venue":null,"work_id":"d6b5ecc7-7d18-4c16-8201-178a20556e73","year":2023},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.034676Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:e43640fa0784dbd28313ae3e3015d078c473cb527713d6bfb0b76a7b1f32f094","observation_id":"f21e3ffd-f1ea-4a4b-a201-08815658a7e1","resolution":{"observed_at":"2026-08-08T10:06:36.279476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.038354Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.038354Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:442df7ab09484b7985b26be5f1ef06787c3ccd274ba80ca6989ead8dad89d977","observation_id":"833b93e9-6b0d-45eb-b5b9-fdddd2923c9d","resolution":{"observed_at":"2026-08-08T10:06:36.038354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.253217Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":"8bbae19f-c7f3-4225-8f98-63503dc5907a","year":2019},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.041955Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:4c12e725a3cd55a76ac98162bbbda6a539b7b61d4e322842497ab35a3f42e29c","observation_id":"988293ba-2ded-4372-8ebd-54de16006b57","resolution":{"observed_at":"2026-08-08T10:06:36.257046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.239941Z","title":"Csr-i (wsj0) complete ldc93s6a,","venue":null,"work_id":"10195551-fd50-4c18-a7d3-51a35fe6347f","year":1993},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.045599Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:0ce1946ae9a67e7442aee5a32774ac45e402c7c136e09ef3b00feef3dfe25b13","observation_id":"ecfaf012-9d1a-4967-b870-84dc9e0d61fb","resolution":{"observed_at":"2026-08-08T10:06:36.243969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01160","last_updated":"2019-07-02T04:27:55Z","snapshot_observed_at":"2026-07-06T08:04:17.909965Z","submitted_at":"2019-07-02T04:27:55Z","title":"WHAM!: Extending Speech Separation to Noisy Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01160","snapshot_observed_at":"2026-08-08T10:06:36.049963Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.049963Z"},"links":{"cited_paper":"/paper/1907.01160","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:b7c65e9126e8ed640627e4820907e1d23f1cc47db9deee34012f05b238417998","observation_id":"fe23e7e1-d0a2-492b-a0ef-d66c5a0e5c28","resolution":{"observed_at":"2026-08-08T10:06:36.049963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.226602Z","title":"Whamr!: Noisy and reverberant single-channel speech separation,","venue":null,"work_id":"a632c0dc-cc61-4496-8899-3afa06ea5501","year":2020},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.053896Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:78432af3b60266cea959c514bd8a003b0d7acf95e404e3e10e0421fc3d15fea1","observation_id":"a15ad033-fe13-4d55-851e-d81c5112c7ad","resolution":{"observed_at":"2026-08-08T10:06:36.230796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01355","last_updated":"2022-04-04T09:57:21Z","snapshot_observed_at":"2026-07-06T12:56:18.100716Z","submitted_at":"2022-04-04T09:57:21Z","title":"Target Confusion in End-to-end Speaker Extraction: Analysis and Approaches","version":1},"cited_work":{"arxiv_id":"2204.01355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01355","snapshot_observed_at":"2026-08-08T10:06:36.098070Z","title":"Target Confusion in End-to-end Speaker Extraction: Analysis and Approaches","venue":"eess.AS","work_id":"ae23d747-9e63-4bbd-906a-3cd23462dda4","year":2022},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.057455Z"},"links":{"cited_paper":"/paper/2204.01355","citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:ac2158b1679364617958cab772ac3f2d4404673bd2bde6204efe80dd4c040427","observation_id":"0a2cad35-1e31-4976-8d1a-f57a28e0ed81","resolution":{"observed_at":"2026-08-08T10:06:36.105012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:06:36.213565Z","title":"Attention is all you need,","venue":null,"work_id":"dbb706e5-04e4-4f9a-80b6-7102d0134029","year":2017},"citing_paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:06:36.061223Z"},"links":{"citing_paper":"/paper/2502.08191"},"observation_digest":"sha256:7e54794f5f28c2666c6b6d920934df81a7b9360e09c88b08f3ffeea0e03e7879","observation_id":"4d426059-eea5-4d34-b37b-064985ae43e2","resolution":{"observed_at":"2026-08-08T10:06:36.217503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08191","last_updated":"2025-02-12T08:03:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T22:21:53.318335Z","submitted_at":"2025-02-12T08:03:27Z","title":"DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2502.08191."}