{"as_of":"2026-08-11T11:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2face031b0a9761d273675cc979a73b243720fe1791436cbb0456ed5b39ebb0","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:10:46.729901Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:37:08.860549Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:22:07.662926Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14477","snapshot_observed_at":"2026-08-07T15:37:08.860549Z","title":"Enhancing intelligibility for generative target speech extraction via joint optimization with target speaker asr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.860549Z"},"links":{"cited_paper":"/paper/2501.14477","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:ed448c4563042ac79bcf4ace5ccf6dc3c4d86270d0a9291a2bc3b9fe2b35435e","observation_id":"df8b61db-204e-4fd2-b94b-825f583d3405","resolution":{"observed_at":"2026-08-07T15:37:08.860549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"cited_work":{"arxiv_id":"2501.14477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14477","snapshot_observed_at":"2026-08-07T14:22:07.662926Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","venue":"eess.AS","work_id":"a5c811a8-63a5-4457-9bd3-49f05fafdaa5","year":2025},"citing_paper":{"arxiv_id":"2505.19314","last_updated":"2025-09-06T14:32:56Z","snapshot_observed_at":"2026-08-09T09:34:05.335498Z","submitted_at":"2025-05-25T21:00:48Z","title":"SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:07.303374Z"},"links":{"cited_paper":"/paper/2501.14477","citing_paper":"/paper/2505.19314"},"observation_digest":"sha256:e3caff1e5c36d06b7007bb9b0dc5647e3c37823a719567cd39cdbe453195b921","observation_id":"25dbd4bf-1922-457e-abd1-dd3165775919","resolution":{"observed_at":"2026-08-07T14:22:07.667941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.14477/citation-record","integrity":"/paper/2501.14477/integrity","json":"/paper/2501.14477/citation-record.json","paper":"/paper/2501.14477"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.582092Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.582092Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:f72ebbec0fdca75d416b803aba7c0b5d743540885dc28a9badb3a7004bbc20a1","observation_id":"e64515a8-7a55-4d01-a669-1be15a21e8d1","resolution":{"observed_at":"2026-08-10T15:10:46.582092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.191903Z","title":"SpeakerBeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"bd01048b-608f-4963-8327-d69c0386a0b0","year":2019},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.623637Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:5fb5213617bd21153d9631deeabbd384ff3976a685ac6c0d17553caa7e696da3","observation_id":"3e8c4950-15d6-425b-a325-e7a2318b43bb","resolution":{"observed_at":"2026-08-10T15:10:47.195307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.179854Z","title":"Improving speaker discrimination of target speech extraction with time-domain speakerbeam,","venue":null,"work_id":"ca7d8dd2-cae4-4651-86f6-aeb551fd7143","year":2020},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.627506Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:6c26e6267c2a11c92c0ebdf399e7ce3268417be7129613171e663ff37709d12a","observation_id":"fcfe31bd-1c2b-4892-b1df-dae02062b0af","resolution":{"observed_at":"2026-08-10T15:10:47.185465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.631159Z","title":"SpEx: Multi-scale time domain speaker extraction network,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.631159Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:c53a62a2a6ace45a97106bb9c940af03551703420e9fbc99a09b1104a49b674b","observation_id":"93bdc0e6-9656-4e04-ae97-cd9bbbb1a8f9","resolution":{"observed_at":"2026-08-10T15:10:46.631159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.163606Z","title":"Target speech extraction with conditional diffusion model,","venue":null,"work_id":"82eda050-d852-4a71-b29b-9f0deb95eb8f","year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.635131Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:57b7b2e7f018af1edb7adab21620d13005d32d39219301abca4dc08dbf23ece7","observation_id":"d4c717d8-3fbb-445e-8cac-eea030e9a485","resolution":{"observed_at":"2026-08-10T15:10:47.167219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.154017Z","title":"Generation- based target speech extraction with speech discretization and vocoder,","venue":null,"work_id":"3dbb35a1-4d40-4bf8-a71d-6d94ba063e53","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.638354Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:815219be90f399ae687c19f4161708f074814dd8a8d306729995887ea4f34132","observation_id":"a8da5e04-21df-499d-88c1-a9a7da46c977","resolution":{"observed_at":"2026-08-10T15:10:47.156907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07841","last_updated":"2024-09-17T01:41:32Z","snapshot_observed_at":"2026-07-06T19:14:12.404382Z","submitted_at":"2024-09-12T08:41:07Z","title":"TSELM: Target Speaker Extraction using Discrete Tokens and Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07841","snapshot_observed_at":"2026-08-10T15:10:46.642096Z","title":"TSELM: Target speaker extraction using discrete tokens and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.642096Z"},"links":{"cited_paper":"/paper/2409.07841","citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:fc949faa8c8f78b89fb1f8bb9ecb47a9887ac63355c4708acff8f1b0bcd80edf","observation_id":"72fe91f6-2256-4f34-859b-83c10e4fe051","resolution":{"observed_at":"2026-08-10T15:10:46.642096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.143491Z","title":"X-Sepformer: End-to-end speaker extraction network with explicit optimization on speaker confusion,","venue":null,"work_id":"07d47606-767a-4129-8369-50e2d693e2fc","year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.645463Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:c4b21d88940110067cf1d486f41fbfb02d29277850b34a937f81ab1ea3041d7e","observation_id":"d37f81d3-ac7a-4cde-8dce-ef0c2d00def9","resolution":{"observed_at":"2026-08-10T15:10:47.147120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.116090Z","title":"Personalized speech enhancement combining band-split rnn and speaker attentive module,","venue":null,"work_id":"21b18c4d-7097-41d4-b5d3-6a83ebc83769","year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.648974Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:eaa70bbd19aa19b481d64f3b99d738b3976e45583f80f628162b10432e7d8ee5","observation_id":"d282659c-dd21-4b2d-8c79-85235707f1db","resolution":{"observed_at":"2026-08-10T15:10:47.121244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16059","last_updated":"2024-12-11T09:39:28Z","snapshot_observed_at":"2026-08-10T01:59:39.417645Z","submitted_at":"2024-10-21T14:38:20Z","title":"Multi-Level Speaker Representation for Target Speaker Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16059","snapshot_observed_at":"2026-08-10T15:10:46.651894Z","title":"Multi- level speaker representation for target speaker extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.651894Z"},"links":{"cited_paper":"/paper/2410.16059","citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:1cc984ba3c596d45cb514d269c7a3a7f43c43870014b0fb5a88a60b2160bb9de","observation_id":"13178b6d-e481-4a2e-9227-e84482ef5244","resolution":{"observed_at":"2026-08-10T15:10:46.651894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.097056Z","title":"Hierarchical speaker representation for target speaker extraction,","venue":null,"work_id":"85c688fc-7376-4a95-9ad1-e22ba107df3f","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.655479Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:ad1e761e92307688071f9455b3b0c9fc8276450238bf5ef4e02272bf42ae8c22","observation_id":"fc4661f7-00c1-45cf-b940-995b05860785","resolution":{"observed_at":"2026-08-10T15:10:47.101057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.083301Z","title":"Extending Whisper with prompt tuning to target-speaker ASR,","venue":null,"work_id":"95fb75ff-7b62-4538-86a6-54f4495b4ee7","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.658867Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:6f170a2fe2ca3eb2ff75eb66947829f896757e9da9b4054c9b2b7552565aaf81","observation_id":"f9ef6128-fec9-402f-b9c4-c32700df0e34","resolution":{"observed_at":"2026-08-10T15:10:47.086726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.071778Z","title":"Empowering Whisper as a joint multi-talker and target-talker speech recognition system,","venue":null,"work_id":"fd6b0f8c-3c73-4232-92fa-65be08409b3d","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.661519Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:0c0ac433ba6d888c7249529d93e8a4a0ceb44dfd5dcca261e6ef79708e107480","observation_id":"ed4a4fa8-2d2c-479b-b71b-863bd58dde34","resolution":{"observed_at":"2026-08-10T15:10:47.076020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.060790Z","title":"SQ-Whisper: Speaker-querying based Whisper model for target-speaker ASR,","venue":null,"work_id":"582d3aa2-471c-4ab9-86b6-03a7a49b2b53","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.664308Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:4221b417874a1193a49569f20d710dbcc8cbaecbfb2fe770c177847bae79ef06","observation_id":"e342ca0a-6445-478a-bb8e-179f59ca1356","resolution":{"observed_at":"2026-08-10T15:10:47.064932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.048573Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"3d52c612-64ad-4e4f-b05d-7095c2582702","year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.667861Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:d14a9a049588cac29290a55832a7d65fd4b474c254b582cd0ed084d678beecb7","observation_id":"17239752-4b59-4f8a-a1cf-0f039e3fa314","resolution":{"observed_at":"2026-08-10T15:10:47.052192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:47.034002Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"9f57a1ea-afdc-4564-af9d-f255a0ed5d9e","year":2022},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.670704Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:815463ef92130b01825471d5a2dc8ed5877bde1f4187a39303a42f595e4ea6b3","observation_id":"e9c76bbf-e0b0-45ce-906c-83d722439235","resolution":{"observed_at":"2026-08-10T15:10:47.037943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.673387Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.673387Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:e25c3748a02dbd274f69e76fe98eb0bb781df166f3906d4567b2de547ae10619","observation_id":"96b622a0-1d44-4d2e-b856-4e7e6a118a3d","resolution":{"observed_at":"2026-08-10T15:10:46.673387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.999046Z","title":"Matcha- TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":"6aee5f8d-3b39-4f33-a120-52b0d27af8b1","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.675876Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:d5c3562a3dd0d00178d50c314f9d64917625f25aa4b85d5ce98819350b5945a2","observation_id":"e4c93146-3020-42a2-9c87-b2d2bfd1be34","resolution":{"observed_at":"2026-08-10T15:10:47.008939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-10T15:10:46.678571Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.678571Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:596afde331c1f1afaf7d5a0e9be1422a5748e96cfb015a5dbc0431b123b46128","observation_id":"6fa45df7-e2a2-428e-ae49-fbae5c7f5d18","resolution":{"observed_at":"2026-08-10T15:10:46.678571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.981456Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":"6479e278-0216-4bfd-bcbb-a558910b6448","year":2020},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.681445Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:43a834460440a7013eae0b1920bb40a2db778e33f88487a07a6ff013c2609025","observation_id":"cd89a5ae-8e9b-4f10-b316-0089f7cd367d","resolution":{"observed_at":"2026-08-10T15:10:46.986025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.964526Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation,","venue":null,"work_id":"d656340e-3d54-45a1-ab26-e3bd0424c125","year":2016},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.684511Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:55215ebda20de757eeea32b44e181f2f578a2c753edd52b3aba7465979294030","observation_id":"e22286fa-806d-41bd-b8aa-2d4b69a430bd","resolution":{"observed_at":"2026-08-10T15:10:46.970794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.687909Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.687909Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:b0fa6ca0d5920e204fc781c8d0e25707c2ba8a4381ba9e0c66dc1e5d711456c8","observation_id":"25e09a36-2e1e-4397-a44f-14f7a1b8b9b7","resolution":{"observed_at":"2026-08-10T15:10:46.687909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15474","last_updated":"2024-08-28T01:44:08Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T01:44:08Z","title":"Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation","version":1},"cited_work":{"arxiv_id":"2408.15474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15474","snapshot_observed_at":"2026-08-10T15:10:46.784697Z","title":"Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation","venue":"eess.AS","work_id":"37968511-1060-4e09-8b59-09992d70cca7","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.691658Z"},"links":{"cited_paper":"/paper/2408.15474","citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:0d4b3fff8df781c3d693c563680156e24bedc4f71403a41c7d4de4e12da0bf4b","observation_id":"d860a433-1951-4857-ab67-e1a204d7d755","resolution":{"observed_at":"2026-08-10T15:10:46.790932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-10T13:43:50.034873Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-10T15:10:46.695561Z","title":"StableVC: Style controllable zero-shot voice conversion with conditional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.695561Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:1266156f2ed6128a79b8c6424da48c2aab2fe2c885f4fa8c535f8554d9ffb9e2","observation_id":"1f28baf5-cf7d-4094-997d-1e7b7545b1e9","resolution":{"observed_at":"2026-08-10T15:10:46.695561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.933837Z","title":"HiFi-GAN: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"699c778f-55fe-45ef-b8b9-80e3772bcec4","year":2020},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.699254Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:08e3d0a68d97b0c4dbd32b97864de88d532576ec498b63505b4165396e14714d","observation_id":"e0eb6be9-90a9-41bf-a34e-fc2692bc919e","resolution":{"observed_at":"2026-08-10T15:10:46.937486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.702516Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.702516Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:ac382648d43792e8efa3b11cba3b73b8aae54615c3f58287651ec2c6167518b5","observation_id":"23f16fff-4312-4732-a716-753ebda57677","resolution":{"observed_at":"2026-08-10T15:10:46.702516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.898641Z","title":"Adapting self- supervised models to multi-talker speech recognition using speaker embeddings,","venue":null,"work_id":"bdbdd107-5b33-470c-9a3b-ff0d9d4928ee","year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.705345Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:a6d2d5c1f7884a8a8d20b46c6c8dbf68be376449e4ee11261b92779802701f77","observation_id":"082f1ea6-a0ad-41f0-b487-b0394f311f39","resolution":{"observed_at":"2026-08-10T15:10:46.903210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.886246Z","title":"Single channel speech separation with constrained utterance level permutation invariant training using grid lstm,","venue":null,"work_id":"bb9eb2a2-7ce5-4513-b578-c4ec682dcf44","year":2018},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.708854Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:256aa55429cf5cc5d6f1b08d35292b6ea66eef7b389900ff87dd60be510dc315","observation_id":"ea68ea39-dc31-43a3-b84c-dd07cc4a4ceb","resolution":{"observed_at":"2026-08-10T15:10:46.889979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.876705Z","title":"DNSMOS P.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"fe2b85be-07ce-43e7-b006-179e65644d2f","year":2022},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.712181Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:599151cf0803e6ecfc11f2bbb9c2ed8e1a043b60a6b193c6e8fba4689ae8942f","observation_id":"b8afd31f-848a-4962-82aa-76c6d4097dc5","resolution":{"observed_at":"2026-08-10T15:10:46.879866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16812","last_updated":"2024-09-01T14:34:27Z","snapshot_observed_at":"2026-08-06T17:12:30.832433Z","submitted_at":"2024-01-30T08:26:28Z","title":"SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16812","snapshot_observed_at":"2026-08-10T15:10:46.715255Z","title":"Speechbertscore: Reference-aware automatic evaluation of speech generation leveraging nlp evaluation metrics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.715255Z"},"links":{"cited_paper":"/paper/2401.16812","citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:0ce9ecb69a6de71e9df559e9fbf99e56b8de4566c9756f7ad5b93b85f5e24b12","observation_id":"1c594bd9-7a28-49c4-9b0c-fd684e0db7b3","resolution":{"observed_at":"2026-08-10T15:10:46.715255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.866720Z","title":"CAM++: A fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":"c18606d5-6513-4834-b633-1fcb88ebf7ff","year":2023},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.718372Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:7f8862cf9e0d15e7811e4f17a64806ec35a8894a44ace61847c71b1f7e6cf1e5","observation_id":"5720d9b5-9734-4c39-b064-5348efef89f8","resolution":{"observed_at":"2026-08-10T15:10:46.869963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.856245Z","title":"SELM: Speech enhancement using discrete tokens and language mod- els,","venue":null,"work_id":"699d0d61-563e-47d0-b385-3eb10d42d407","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.721074Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:2df6c7ab93f811b47ee0cfe52e8a9a22abdc4cba799ba4697dd00911a3571b87","observation_id":"d1452fe5-15e0-49d6-9c63-f139780b8ebf","resolution":{"observed_at":"2026-08-10T15:10:46.859584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.726366Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.726366Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:093c6d042c0fb92a2f8f89c2cf7d48a4bdd55eaa503f336ca4fffb930b62fc57","observation_id":"ce9906db-1e5f-4ad5-8f8a-f117e3369987","resolution":{"observed_at":"2026-08-10T15:10:46.726366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:10:46.835609Z","title":"Music source separation with band-split rope transformer,","venue":null,"work_id":"550db393-9939-441c-a208-cad8ab2e68c4","year":2024},"citing_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:10:46.729901Z"},"links":{"citing_paper":"/paper/2501.14477"},"observation_digest":"sha256:852e47d1615c6ce741d0c83a94099bf719de1421b1224bc0dc2fd2b176cc611e","observation_id":"b19be8a5-f6a0-4511-a199-e0cdff379eb3","resolution":{"observed_at":"2026-08-10T15:10:46.839711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T15:05:14.025538Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2501.14477."}