{"as_of":"2026-08-09T19:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b59ce9272eae7f755e196c8c312fc113bcd30c22512fd33041878d9d2a16089","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:58:13.747106Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T00:58:13.613182Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.27436","snapshot_observed_at":"2026-07-31T00:58:13.613182Z","title":"Generalized Target Speaker Extraction Letx∈R T denote a mixture speech ands∈R T denote the tar- get speech in the mixture","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.613182Z"},"links":{"cited_paper":"/paper/2607.27436","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:1b76533c675e73453f12f542af29f3b92cc07965a7e66abd0d3dd4834063b925","observation_id":"633c1e70-c5af-4cb9-9e38-8080bd1f9915","resolution":{"observed_at":"2026-07-31T00:58:13.613182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.27436/citation-record","integrity":"/paper/2607.27436/integrity","json":"/paper/2607.27436/citation-record.json","paper":"/paper/2607.27436"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.608691Z","title":"Deep learning has significantly improved separation performance un- der controlled conditions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.608691Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:749e5d1e30e4728c73b6f7a3f986a9c6988914df15d862632913227a2479c1c2","observation_id":"7cda655a-b846-4a42-9bc1-9aeb82623079","resolution":{"observed_at":"2026-07-31T00:58:13.608691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.27436","snapshot_observed_at":"2026-07-31T00:58:13.613182Z","title":"Generalized Target Speaker Extraction Letx∈R T denote a mixture speech ands∈R T denote the tar- get speech in the mixture","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.613182Z"},"links":{"cited_paper":"/paper/2607.27436","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:1b76533c675e73453f12f542af29f3b92cc07965a7e66abd0d3dd4834063b925","observation_id":"633c1e70-c5af-4cb9-9e38-8080bd1f9915","resolution":{"observed_at":"2026-07-31T00:58:13.613182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.617340Z","title":"It operationalizes the generalized TSE for- mulation in Section 2 and supports systematic exploration of single-, multi-, and heterogeneous-cue settings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.617340Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:5586ee5238aa8f681fdbad7cabd99086da2622f749f3e6a202a5964375340f18","observation_id":"f1e60e79-5593-40ea-b51a-c851149cc943","resolution":{"observed_at":"2026-07-31T00:58:13.617340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.621040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.621040Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:1980ffa46c98eaebf8f39b0c031116ee4cb1b4785719256084757408bbf8d7b7","observation_id":"28fde3a6-e52e-4fa8-9510-ea26b94e07e9","resolution":{"observed_at":"2026-07-31T00:58:13.621040Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.624975Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.624975Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:db2cf0de9eac1fa3ca680d747429da1e0f8ccfdd084ca5fce6af89108221556c","observation_id":"58d7f203-7605-45b1-bf82-5ab0f2a839c1","resolution":{"observed_at":"2026-07-31T00:58:13.624975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.628359Z","title":"62401377 and No","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.628359Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:93f3ebc64618ad0f32305ec683ee60c900985624b43082056b7ed0c7d27f6d0b","observation_id":"7ef3e099-7689-4789-887d-99c2f164d437","resolution":{"observed_at":"2026-07-31T00:58:13.628359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.631873Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.631873Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:1975a1786c5d66d76e3c1ed42db717c4fd27971642579cde542efc151576c5e1","observation_id":"9024c6b7-980f-4f95-8e99-7e8b70ad501a","resolution":{"observed_at":"2026-07-31T00:58:13.631873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10830","last_updated":"2025-08-14T16:54:34Z","snapshot_observed_at":"2026-08-07T14:56:56.307138Z","submitted_at":"2025-08-14T16:54:34Z","title":"Advances in Speech Separation: Techniques, Challenges, and Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10830","snapshot_observed_at":"2026-07-31T00:58:13.635128Z","title":"Advances in speech separation: Techniques, challenges, and future trends,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.635128Z"},"links":{"cited_paper":"/paper/2508.10830","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:c3e574b1eedd8f7cfc77462abd681f9183bedb109ca9fec87b068bc241112239","observation_id":"5a7ff657-1d6c-4021-9c83-4b159a90bbf3","resolution":{"observed_at":"2026-07-31T00:58:13.635128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.638827Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.638827Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:dbcac1de4a5ef963853f9c8ae95ba248d3945ee679e82d88326d15a437cf38a7","observation_id":"e559aa31-fce4-4c92-a122-1180779faadd","resolution":{"observed_at":"2026-07-31T00:58:13.638827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.642120Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.642120Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:28ef05fa3901e03c1a88043bcd032ae42705f8b39881dc6c76c004c99bbe9d5e","observation_id":"7aacfac9-9a35-45d0-be5f-249dd05ff061","resolution":{"observed_at":"2026-07-31T00:58:13.642120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.645313Z","title":"Usef-tse: Universal speaker embedding free target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.645313Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:661951483ba3e5d2eef3e24c8caabca00251e8d85edfdf1716e94615cd7bd654","observation_id":"07ceedce-ca77-4d6e-8b01-14ca17fd3a6d","resolution":{"observed_at":"2026-07-31T00:58:13.645313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.648804Z","title":"Multi-level speaker representation for target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.648804Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:e5a026d0aa4cec84371374a7f30258178c33ae70657bd09f12d889b91b2a7ccc","observation_id":"c48121e5-81ea-428b-8b41-789b789c8386","resolution":{"observed_at":"2026-07-31T00:58:13.648804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.652138Z","title":"Listen to extract: Onset-prompted target speaker extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.652138Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:4bd16e1e996f7bf85b38dd43fc48cdb648c5b263eb5cfff6930d19a437a99676","observation_id":"7dc5a566-ac56-46ed-acf4-c9825dfe3eee","resolution":{"observed_at":"2026-07-31T00:58:13.652138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.655305Z","title":"3d spatial features for multi-channel target speech separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.655305Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:5d2cc02c299337ddbdbaa22b9fb411be727ae8b2497f5e42ea00482e39fba37d","observation_id":"24d61268-f80a-47e3-acda-7cf5782dc481","resolution":{"observed_at":"2026-07-31T00:58:13.655305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.659084Z","title":"3s-tse: Efficient three-stage target speaker extraction for real-time and low-resource applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.659084Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:c941403cf043c7bf35fb281720c5f7d1cbe45b0c6587c4027f0aa6f79554dd65","observation_id":"707a22bd-fa25-47ea-bd10-8445f75e440f","resolution":{"observed_at":"2026-07-31T00:58:13.659084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.662112Z","title":"Doa or speaker embed- ding: Which is better for multi-microphone target speaker extrac- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.662112Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:2a9842a5d2ce0fb7afd5b240004253f24a0f9aeeb95860c29df4d09fac1e976b","observation_id":"cbdf3d8d-d2bd-4ca3-bbca-a8e388f32a33","resolution":{"observed_at":"2026-07-31T00:58:13.662112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.665309Z","title":"Muse: Multi-modal tar- get speaker extraction with visual cues,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.665309Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:31dea55230f325fcad886ad1c0bed921a52106ef2052874042ed69eb29370739","observation_id":"59fd683b-8852-4701-a3fa-4c2b42fed570","resolution":{"observed_at":"2026-07-31T00:58:13.665309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.669003Z","title":"Usev: Universal speaker extraction with visual cue,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.669003Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:86d7c76d82d47952d2b747a9a3845b37affdde75c20583fd52ce03a55981f238","observation_id":"40729d69-5bd8-4a27-926e-ef2bd86dc57a","resolution":{"observed_at":"2026-07-31T00:58:13.669003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.671879Z","title":"Efficient audio-visual speech separa- tion with discrete lip semantics and multi-scale global-local atten- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.671879Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:75c180532fa99f6dd83e1f52a18d4b3284b688d9b2e0b791d086d48a5f3d279f","observation_id":"336076a2-4259-4566-b556-eccb34e13a8f","resolution":{"observed_at":"2026-07-31T00:58:13.671879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07977","last_updated":"2026-06-07T08:01:33Z","snapshot_observed_at":"2026-08-06T12:39:56.583950Z","submitted_at":"2026-02-08T14:06:11Z","title":"Detect, Attend and Extract: Keyword Guided Target Speaker Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07977","snapshot_observed_at":"2026-07-31T00:58:13.674758Z","title":"Detect, attend and extract: Keyword guided target speaker extraction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.674758Z"},"links":{"cited_paper":"/paper/2602.07977","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:66cd81ef6123edb0a205970e940c9e367200612dce7f2c2c1e25bd4f738cfe2a","observation_id":"e8d614d7-6b92-4100-9602-2d70ff910ecd","resolution":{"observed_at":"2026-07-31T00:58:13.674758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.679032Z","title":"Contex- tual speech extraction: Leveraging textual history as an implicit cue for target speech extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.679032Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:9b54a5f82d62c9c3b0604fe70ac0e04cd15265357a2e7699a32d49813c86bf2e","observation_id":"d6c30afe-afbb-478c-8861-5436b26b1a50","resolution":{"observed_at":"2026-07-31T00:58:13.679032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.682321Z","title":"Speaker Extraction with Detection of Presence and Absence of Target Speakers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.682321Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:7ac583e78469e4dd37abc8d4b8375cda8d3e47af63957ff26b9ae8d8e59a672d","observation_id":"2aa980d1-0df6-42e8-adc3-c4b20fd89d46","resolution":{"observed_at":"2026-07-31T00:58:13.682321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.685605Z","title":"Momuse: Momentum multi-modal target speaker extraction for real-time scenarios with impaired visual cues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.685605Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:f9d899dd458f67ab8ea5c5a9db0d1d362b119e4d009c2bfe8af8cac1d4a584c5","observation_id":"20d1f8be-33fe-4df8-904e-1b232f99af31","resolution":{"observed_at":"2026-07-31T00:58:13.685605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.688600Z","title":"Multimodal attention fusion for target speaker ex- traction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.688600Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:fd907e934a02d58b93a22fb9cac857bf0b850caa6776b0055e18a0959a376f4a","observation_id":"9c466080-9524-4cd3-9922-414c35719e65","resolution":{"observed_at":"2026-07-31T00:58:13.688600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.691801Z","title":"Beyond speaker identity: Text guided target speech ex- traction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.691801Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:802ab27fd143ea1ce19cde5146026e23933e46e171fe4cdeea8304cc94bfc827","observation_id":"14fb368d-02a1-44b9-9cb3-1f622e337a6f","resolution":{"observed_at":"2026-07-31T00:58:13.691801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.694838Z","title":"WeSep: A Scalable and Flexible Toolkit Towards Gen- eralizable Target Speaker Extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.694838Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:47de9aa6b7c126ee89c0503a65b5641e213a109b90df71d4c5e7a33169282a6c","observation_id":"3ca07a5a-07b2-4c86-aa42-41fdf15d23d3","resolution":{"observed_at":"2026-07-31T00:58:13.694838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.698107Z","title":"ClearerV oice-Studio: Bridging Ad- vanced Speech Processing Research and Practical Deployment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.698107Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:f33fe2720fb47ac802bce43ab0ad3a7f8d1fc014815c56ac22ac68b8ddc12d92","observation_id":"abbf2fb1-b965-45dd-a007-46e3cac6a940","resolution":{"observed_at":"2026-07-31T00:58:13.698107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.701313Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.701313Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:e81d09610000391d1b24650d8e423fde2a7d6a55839dcb932452ed7bfe47982b","observation_id":"9c06811d-3e5a-45e9-972e-8ff951c6287f","resolution":{"observed_at":"2026-07-31T00:58:13.701313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.704803Z","title":"ECAPA- TDNN: Emphasized Channel Attention, Propagation and Aggre- gation in TDNN Based Speaker Verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.704803Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:cde1189a900d4aea4cc04ecf3e35e6b951f84498cc95d04210e73d2a90eed9dc","observation_id":"9747c5db-65d9-48be-ae97-fb5c8e10cd64","resolution":{"observed_at":"2026-07-31T00:58:13.704803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.708034Z","title":"A study of multichannel spatiotemporal features and knowledge distillation on robust target speaker extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.708034Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:61fde42cee9200f66eb26ac75795bd178dd0fd153bf282602f9e7ac9cf197160","observation_id":"bb8f5bd5-5f6c-4fc8-b3dd-d1986ca7fa26","resolution":{"observed_at":"2026-07-31T00:58:13.708034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20926","last_updated":"2025-07-28T15:36:30Z","snapshot_observed_at":"2026-08-06T13:13:03.576056Z","submitted_at":"2025-07-28T15:36:30Z","title":"End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20926","snapshot_observed_at":"2026-07-31T00:58:13.711323Z","title":"End-to-end doa-guided speech extraction in noisy multi-talker scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.711323Z"},"links":{"cited_paper":"/paper/2507.20926","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:f0ef9c2576ea38df7af786d2d98ecc871c1db21faa47a72a5256879d22aeec3b","observation_id":"83d52725-d8fa-47ae-b9f0-e0dea7aea5d0","resolution":{"observed_at":"2026-07-31T00:58:13.711323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.714925Z","title":"Spatially selective deep non-linear filters for speaker extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.714925Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:34674a4483df98849e568c4b6f4a548a90bbf01ea3a77cf72bd31385d1e5f881","observation_id":"f0fd3e8f-f9dd-41d7-9cbf-9d9de83780d5","resolution":{"observed_at":"2026-07-31T00:58:13.714925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.718093Z","title":"Dpccn: Densely- connected pyramid complex convolutional network for robust speech separation and extraction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.718093Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:2a372c2e8a541f826487b3cb35511d01910c0343a8e219fa7baa587864a0b873","observation_id":"16f331ad-5cbc-45f4-8a1c-f2d7dd787d9f","resolution":{"observed_at":"2026-07-31T00:58:13.718093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.721237Z","title":"Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.721237Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:db31bb32804559e5c717ffe9bb52fb7d2bd78a4a222d21240bbe9f0e1ccf6044","observation_id":"033264c1-7d4a-4528-8c77-cef666405b4e","resolution":{"observed_at":"2026-07-31T00:58:13.721237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.724769Z","title":"Music source separation with band-split rnn,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.724769Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:dcae17cbe22a303bcbfd39c59872c07f6afeb833a6c631b292416ad3da5a413b","observation_id":"0f8b26ef-70ac-422d-9bbf-aa206cddb358","resolution":{"observed_at":"2026-07-31T00:58:13.724769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.727742Z","title":"Tf-gridnet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.727742Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:01e1507dca700b7271f15881f837eff80749224b551cd7a5461da4a0857a3cec","observation_id":"2f09ade8-56b6-44f7-a69a-743735eaa37d","resolution":{"observed_at":"2026-07-31T00:58:13.727742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02076","last_updated":"2022-12-05T07:44:32Z","snapshot_observed_at":"2026-08-09T05:49:19.078039Z","submitted_at":"2022-12-05T07:44:32Z","title":"NBC2: Multichannel Speech Separation with Revised Narrow-band Conformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02076","snapshot_observed_at":"2026-07-31T00:58:13.730997Z","title":"Nbc2: Multichannel speech separation with revised narrow-band conformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.730997Z"},"links":{"cited_paper":"/paper/2212.02076","citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:2b764d83b9b096c511ee14da526f0d97a0c98a4b35c3677a6d7203548c4af2a7","observation_id":"b30f684a-4dfd-465d-85eb-e87d56c80c27","resolution":{"observed_at":"2026-07-31T00:58:13.730997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.734390Z","title":"Sdr– half-baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.734390Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:71926cdf490c3bf8248876975bb195029d158e408551da3edb12d3b748e7eab7","observation_id":"5b483fb0-bb24-4fb0-bd96-b108186eb2ca","resolution":{"observed_at":"2026-07-31T00:58:13.734390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.737494Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.737494Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:d48c9aec6989b58dc383494fc48f51864ba816f8e10920f00f316e4ab0a07464","observation_id":"f403b5aa-0aa4-4497-a1ff-d4dadc635cf6","resolution":{"observed_at":"2026-07-31T00:58:13.737494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.740888Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.740888Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:1286675d7899c1e9e1451867a48be2d42c1ece1c27ce89c7f43ec93a62d83883","observation_id":"31be0857-0807-4b51-8ad7-67fd19b78a66","resolution":{"observed_at":"2026-07-31T00:58:13.740888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.743928Z","title":"100 nonspeech environmental sounds,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.743928Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:a6469ccc275cc7854027d78fef332186e9e6daf9fdac051e813a7daf9a2edfbb","observation_id":"ad710a61-a4c7-4812-8c4f-123b51872e5d","resolution":{"observed_at":"2026-07-31T00:58:13.743928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T00:58:13.747106Z","title":"gpurir: A python library for room impulse response simulation with gpu acceler- ation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T00:58:13.747106Z"},"links":{"citing_paper":"/paper/2607.27436"},"observation_digest":"sha256:23f8c87c88db471fb48e555e8bcfdec6a8694a117ddd0f541a24f237983409e2","observation_id":"82e38d44-694d-4754-adea-28b4ce3ab08f","resolution":{"observed_at":"2026-07-31T00:58:13.747106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27436","last_updated":"2026-07-29T20:05:39Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T01:15:56.832491Z","submitted_at":"2026-07-29T20:05:39Z","title":"WeSep: A Modular and Cue-Composable Framework for Target Speaker Extraction"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2607.27436."}