{"as_of":"2026-08-19T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6170bfccbe9244dac33786b51914e7cffaa9760065438453b8692fb53a650d88","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:14:00.754527Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09169/citation-record","integrity":"/paper/2501.09169/integrity","json":"/paper/2501.09169/citation-record.json","paper":"/paper/2501.09169"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.348783Z","title":"V oiceFilter: Targeted V oice Separation by Speaker-Conditioned Spectrogram Masking,","venue":null,"work_id":"6704c47b-5f96-4f89-b9f8-a11d413ed941","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.599522Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:a847612b7aaa25e86cbe3ee7798e0b26303158b10f8f15d10db782189270c3b4","observation_id":"5effb835-1de0-438e-89e6-e1e2f390e16f","resolution":{"observed_at":"2026-08-10T20:14:01.355088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.605275Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.605275Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:b384dc1b1421dcdf6e45dd2f18b29058ec4462ec60be3414196aba77fa01908c","observation_id":"943e1499-b812-41fa-bb79-310e48e11aae","resolution":{"observed_at":"2026-08-10T20:14:00.605275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.320625Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":"f0668c0d-a1db-4abb-af00-5613bb260db7","year":2020},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.610679Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:f6eff9f6d58dde03c81cb090b20efdcd45fc9ae76287feee56543577f55245b1","observation_id":"7b4987b4-d832-4ac2-aae7-a985417ee1c3","resolution":{"observed_at":"2026-08-10T20:14:01.326227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.299207Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation,","venue":null,"work_id":"5c3800ed-def9-49d7-a803-3ab9e18c1d23","year":2018},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.615829Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:6731f654614689605530088a853ca55ebffb6fa541cc9f25b564ebf08db8f137","observation_id":"f0fbe5aa-2ab5-461b-9476-76768b5506bd","resolution":{"observed_at":"2026-08-10T20:14:01.308630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.261027Z","title":"Multimodal SpeakerBeam: Single channel target speech extraction with audio-visual speaker clues","venue":null,"work_id":"80a1f1c7-a6ca-40d0-a98b-56646ca4ce51","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.621232Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:c3d7533910cb0a26d2eb82d555567e7529f6ae6269e90dfbc48329a23868ba83","observation_id":"76c6c715-309f-4dc5-9c9f-3b9eb7f7f082","resolution":{"observed_at":"2026-08-10T20:14:01.269058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.231378Z","title":"Text-driven separation of arbitrary sounds,","venue":null,"work_id":"330f6e7d-471a-468a-89a2-9dc42ab7c933","year":2022},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.625979Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:2c574f92cf23e8cd67c9aceb7612e39846cd1931cb1c6a883a7fa114c6a39766","observation_id":"0d3fb154-6984-4e9f-8660-e71b78b8e072","resolution":{"observed_at":"2026-08-10T20:14:01.241447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.207514Z","title":"CLIPSep: Learning text-queried sound separation with noisy unlabeled videos,","venue":null,"work_id":"47692c72-d6bd-459c-a7cf-0ada8c9dd2cf","year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.631961Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:75ece312be177a9fc66fd76f38004120cb196b2bb645f9ad994dfcdc84a51fb6","observation_id":"d5f7358f-6ef5-4371-a0e1-12e6f3660e6b","resolution":{"observed_at":"2026-08-10T20:14:01.213502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05037","last_updated":"2024-12-01T15:17:03Z","snapshot_observed_at":"2026-08-18T07:25:36.185198Z","submitted_at":"2023-08-09T16:09:44Z","title":"Separate Anything You Describe","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05037","snapshot_observed_at":"2026-08-10T20:14:00.636550Z","title":"Separate anything you describe,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.636550Z"},"links":{"cited_paper":"/paper/2308.05037","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:1308aecd443ffe1cc69e8ca1eac11d3d77e1de72753f6a7c16e1973c93e50f68","observation_id":"790022a0-24b9-470c-a242-b5139b912fd3","resolution":{"observed_at":"2026-08-10T20:14:00.636550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.185016Z","title":"Target sound extraction with variable cross-modality clues,","venue":null,"work_id":"8b2f8e7a-2890-4a81-8169-a74821a33b44","year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.641820Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:8d4b67766b6a9e227f1ed1294cf553dd0dce8da41e2055321702e4caa7952281","observation_id":"d799943c-7b47-4695-a756-f868eecb56de","resolution":{"observed_at":"2026-08-10T20:14:01.193632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17455","last_updated":"2025-03-21T12:55:53Z","snapshot_observed_at":"2026-08-16T14:14:55.931478Z","submitted_at":"2024-02-27T12:27:18Z","title":"CLAPSep: Leveraging Contrastive Pre-trained Model for Multi-Modal Query-Conditioned Target Sound Extraction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17455","snapshot_observed_at":"2026-08-10T20:14:00.646171Z","title":"CLAPSep: Leveraging contrastive pre-trained models for multi- modal query-conditioned target sound extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.646171Z"},"links":{"cited_paper":"/paper/2402.17455","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:f11c613a9369efe3eb74f0b871e1d901050aaea5d69228c359c97b6793bf3180","observation_id":"c8714b0d-7845-4bf9-979a-8fafcb4697ea","resolution":{"observed_at":"2026-08-10T20:14:00.646171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07284","last_updated":"2024-10-07T06:54:30Z","snapshot_observed_at":"2026-08-18T18:42:16.817519Z","submitted_at":"2023-10-11T08:17:54Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07284","snapshot_observed_at":"2026-08-10T20:14:00.651546Z","title":"Typing to listen at the cocktail party: Text-guided target speaker extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.651546Z"},"links":{"cited_paper":"/paper/2310.07284","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:161fe4739819c7b594f6a9ee25cdc11accdb4e49546139f4b421fddfbbfc2259","observation_id":"4577da83-0503-427c-b818-f8e6f8c9f220","resolution":{"observed_at":"2026-08-10T20:14:00.651546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07198","last_updated":"2024-06-11T12:18:18Z","snapshot_observed_at":"2026-08-18T15:32:18.340950Z","submitted_at":"2024-06-11T12:18:18Z","title":"Target Speech Diarization with Multimodal Prompts","version":1},"cited_work":{"arxiv_id":"2406.07198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07198","snapshot_observed_at":"2026-08-10T20:14:00.851964Z","title":"Target Speech Diarization with Multimodal Prompts","venue":"eess.AS","work_id":"53e657c4-b2ef-4177-8d00-37d2183d2601","year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.657124Z"},"links":{"cited_paper":"/paper/2406.07198","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:7db10f242f470c4d8823ef6913c2efdc3231858d04eb7d27f10247d6a1ab8304","observation_id":"529930c3-ceed-44b9-968d-e6124fc551b3","resolution":{"observed_at":"2026-08-10T20:14:00.859643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.159149Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"e3800757-5e41-4e76-960c-32f3a8aecc69","year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.662412Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:a82d6186611e867cb401f32b193f0e90937f0e2995bfe4c34e371313293a09be","observation_id":"41becd24-0ace-429c-ba4f-8606c5eb6231","resolution":{"observed_at":"2026-08-10T20:14:01.165097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-18T17:51:41.801692Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-10T20:14:00.667684Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.667684Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:ec3022493184613c0400226b33172f44213e74f2310d34ce1fd76f8b62a97759","observation_id":"bdb63dc3-bd02-477b-beed-6ff8d0783781","resolution":{"observed_at":"2026-08-10T20:14:00.667684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.142341Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":"1fab3c02-b916-4544-a336-eee9e4295eb1","year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.675548Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:981da928e5a0aebf658bbf289110aaf7ef8b10993a107b134eb332088c824106","observation_id":"f3eed92a-141a-444f-925f-a158c500a3a3","resolution":{"observed_at":"2026-08-10T20:14:01.147416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.118565Z","title":"Optimization of speaker extraction neural network with magnitude and temporal spectrum approximation loss,","venue":null,"work_id":"c00f565f-618f-4ae0-a045-61ff9e88bc18","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.681693Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:a21d16d92ae1d99bea9f6362f7b3f53afd41df705078efb8315f8aa640cdc8aa","observation_id":"17418e5a-10de-456d-8c14-58a147cb9a53","resolution":{"observed_at":"2026-08-10T20:14:01.124753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T20:14:00.691235Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.691235Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:551c4f17f1fa87a8044c6743a81cc5ccd03804825a08868aed4cc5761feb2828","observation_id":"2335e1c5-3911-4214-a303-5b7847321c5f","resolution":{"observed_at":"2026-08-10T20:14:00.691235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.095081Z","title":"Dual-path rnn: efficient long sequence modeling for time-domain single-channel speech sepa- ration,","venue":null,"work_id":"336675f2-6b2c-434d-86e0-56b3357c7733","year":2020},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.703745Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:e58454093342f7fa20f50ba5d18931c9cc60fad9eb4e9177ecccab051e7164c2","observation_id":"80c66340-71a3-460d-93f6-0d24113b728a","resolution":{"observed_at":"2026-08-10T20:14:01.103312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.055357Z","title":"Deep neural networks for acoustic modeling in speech recognition: The shared views of four research groups,","venue":null,"work_id":"3523ae15-d199-43ec-97cf-9b337ba23c93","year":2012},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.709583Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:90906ea9f6164213d8cb5b2f91da61c709029a6f7f2e2782448b72c6804bb461","observation_id":"4bb5b753-248c-4144-a981-612c9e84d0d8","resolution":{"observed_at":"2026-08-10T20:14:01.060804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.715163Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.715163Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:39a9980963d8193452e61e0f83077a9585bc5a07d1b7929a525a4a830d19a850","observation_id":"540a7d0f-2926-478c-821e-9abe2cbc5e3f","resolution":{"observed_at":"2026-08-10T20:14:00.715163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T20:14:00.721189Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.721189Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:fec924f71f24ec0544e7a5513de430925bf3d80cc33097c9bd062ce5b046e4f1","observation_id":"06270b51-d33d-43fc-8a96-84f584383de9","resolution":{"observed_at":"2026-08-10T20:14:00.721189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:01.026405Z","title":"Semi- supervised time domain target speaker extraction with attention,","venue":null,"work_id":"4ba0b0c1-f730-4e7c-8fb6-9288bbf7e45e","year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.726748Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:f34b49c15ac40284acfc7c7cb32632befc2a8d954bfde75bfac85f0af413d9f4","observation_id":"8491beed-4259-4cc3-a58f-5bb734d19bae","resolution":{"observed_at":"2026-08-10T20:14:01.032498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.998034Z","title":"Performance measure- ment in blind audio source separation,","venue":null,"work_id":"e44017b5-9d3e-4f53-a128-12501e6d51fe","year":2006},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.731405Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:323dcd8fe285ce1a732fe016b3a3dfde1d779607fca2b64b484b5eb412e9a628","observation_id":"bb48f634-17e7-43d2-ae8f-024f92d5d5b3","resolution":{"observed_at":"2026-08-10T20:14:01.011895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.979671Z","title":"Wavesplit: End-to-end speech sep- aration by speaker clustering,","venue":null,"work_id":"6d922203-be8e-4291-bcf7-e9891f5e01a2","year":2021},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.737069Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:19ddfed8e74b2f4715c4c05023688577c835fa8fad05c2fede2231b8a1322aba","observation_id":"1ef555f1-f253-4f8b-a894-1524efce4221","resolution":{"observed_at":"2026-08-10T20:14:00.985082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.963198Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"e1fd3d7c-0ad9-4ab4-b20b-c1b66360bd6b","year":2001},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.742812Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:b209a49bc4d980295bf4ffbe0d5dff017130d66189a8af3e7e327de3e34ca769","observation_id":"44f33c04-f025-45f8-bbd4-e5dbf6544a93","resolution":{"observed_at":"2026-08-10T20:14:00.968610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.948281Z","title":"Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"456b2207-ee16-4dad-8604-e6a4237ed6e1","year":2019},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.749916Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:3ed8dd1bfbc0586795dd666c5df5fc30228aa3afb41cd523a175652412533c3a","observation_id":"c4e21c3a-685c-4476-af3d-6a1e468f98e7","resolution":{"observed_at":"2026-08-10T20:14:00.952605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:00.934771Z","title":"Self-supervised disentangled representation learning for robust target speech extraction,","venue":null,"work_id":"e752b65c-4053-4b8d-ac3e-ca0dfc76b548","year":2024},"citing_paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:00.754527Z"},"links":{"citing_paper":"/paper/2501.09169"},"observation_digest":"sha256:13e283bb4fdc953a949df33423c2427ae0b81f738679d8231c1e0086a9edbd84","observation_id":"287ae483-999f-4ee8-ae62-19339118296c","resolution":{"observed_at":"2026-08-10T20:14:00.939537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09169","last_updated":"2025-01-15T21:43:49Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T03:49:15.307316Z","submitted_at":"2025-01-15T21:43:49Z","title":"Beyond Speaker Identity: Text Guided Target Speech Extraction"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2501.09169."}