{"as_of":"2026-08-17T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c1879305891e902fdebe9dc1beef44713508c414049925343d215c4989bb836","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:37:11.459923Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:37:06.827583Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:45:19.435188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14465","snapshot_observed_at":"2026-08-07T15:37:06.827583Z","title":"TSE has gained significant attention for its role in improving speech clarity in communication systems and enhancing hearing aids for indi- viduals with hearing impairments [1, 2]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:06.827583Z"},"links":{"cited_paper":"/paper/2505.14465","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:8b64b6294ee755d7660dcf90f16cbeeae9a3adfb9f4a3ac14982d8337c107eb6","observation_id":"69f41c69-aa66-4307-919d-f8bc0c3f52a6","resolution":{"observed_at":"2026-08-07T15:37:06.827583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"cited_work":{"arxiv_id":"2505.14465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14465","snapshot_observed_at":"2026-08-07T04:45:19.435188Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","venue":"eess.AS","work_id":"a7ae9083-3a5d-47fa-bcbf-3cdfdd1531e7","year":2025},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-17T02:21:03.433032Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.031576Z"},"links":{"cited_paper":"/paper/2505.14465","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:b78e07c341228c9e68196faa1ce13af6045e95fa4d1cbccd85ae34595bf3ee60","observation_id":"d4c66cb4-ace9-4a88-8fcf-9256a36ca013","resolution":{"observed_at":"2026-08-07T04:45:19.443377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14465/citation-record","integrity":"/paper/2505.14465/integrity","json":"/paper/2505.14465/citation-record.json","paper":"/paper/2505.14465"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14465","snapshot_observed_at":"2026-08-07T15:37:06.827583Z","title":"TSE has gained significant attention for its role in improving speech clarity in communication systems and enhancing hearing aids for indi- viduals with hearing impairments [1, 2]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:06.827583Z"},"links":{"cited_paper":"/paper/2505.14465","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:8b64b6294ee755d7660dcf90f16cbeeae9a3adfb9f4a3ac14982d8337c107eb6","observation_id":"69f41c69-aa66-4307-919d-f8bc0c3f52a6","resolution":{"observed_at":"2026-08-07T15:37:06.827583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:16.899479Z","title":"SE methods are generally categorized as discriminative or generative","venue":null,"work_id":"f149c290-0901-4da2-a794-bf04f7a7c2c7","year":null},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:06.928181Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:bb909b6f684fedafff7129a14ade4862d659d2151986f4511dc976c0dd423183","observation_id":"518a4d9a-1812-4ad6-bc2e-2d93607cb62e","resolution":{"observed_at":"2026-08-07T15:37:16.971965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:16.635628Z","title":"Our method maintains a simple pipeline that does not rely on external pretrained models besides the vocoder, which converts mel spectrograms into audio","venue":null,"work_id":"7e0ecffd-1b8a-4e21-97e4-2f67fa081400","year":null},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.048342Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:d0ff10c31bba2ede9472feaaab31f194d4e06a43290cd7aeb83b1ac61d007f98","observation_id":"4ba22c9b-600f-4567-bc47-1ba3ceba1319","resolution":{"observed_at":"2026-08-07T15:37:16.751190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:16.370269Z","title":"Experimental Setup Datasets","venue":null,"work_id":"ca1d1a6d-f5c7-4a7c-b1eb-8bc2265ec375","year":null},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.203194Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:3fe05aa757a74acd56a66a61b0c12dd49f8817d9ddab2e19339e3868b2666850","observation_id":"896cdbb7-1382-4849-81da-c0a91bcdb952","resolution":{"observed_at":"2026-08-07T15:37:16.460613Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:16.160256Z","title":"We leverage recent advancements in flow matching to condition our model on the target speaker’s audio","venue":null,"work_id":"d53b40ee-32e3-425d-b896-dff02cb546b6","year":null},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.283006Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:d913b0e348d0f2f32980b49652d9f34272669b1b3f37481513d4babd85b1e501","observation_id":"97d9fcab-a15c-45c4-a8e1-94932f192250","resolution":{"observed_at":"2026-08-07T15:37:16.258237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:15.984767Z","title":"wtimit2mix: A cock- tail party mixtures database to study target speaker extraction for normal and whispered speech,","venue":null,"work_id":"0874703c-a252-4a3b-8e0c-6abe874cc59e","year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.426264Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:5c4c174ee3a65a1183684d3c34003ebe8ee0526c13a69bec0fa5e13f8d01b72a","observation_id":"ecb5aba0-6aef-4d86-9269-84fbe97b9b2c","resolution":{"observed_at":"2026-08-07T15:37:16.074787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:15.813092Z","title":"Ddtse: Discriminative diffusion model for target speech extraction,","venue":null,"work_id":"6ea48a88-25d0-4b3f-94ce-9e646d7ddfc7","year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.551092Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:c75843fe307b03a14c8756ef2f9afe6a986cdfe9bee84dc4800228bdb48c61e8","observation_id":"a929353c-1d3e-4b41-8d10-f96ed0ae60de","resolution":{"observed_at":"2026-08-07T15:37:15.910383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09543","last_updated":"2025-01-16T09:51:19Z","snapshot_observed_at":"2026-08-16T13:18:31.140093Z","submitted_at":"2024-09-14T21:46:00Z","title":"Target Speaker ASR with Whisper","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09543","snapshot_observed_at":"2026-08-07T15:37:07.667904Z","title":"Target speaker asr with whisper,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.667904Z"},"links":{"cited_paper":"/paper/2409.09543","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:667c771e695f97f56712269424986e6774c410719f4f1cee7ed4a1b0ecb6a10c","observation_id":"c355b67d-53f4-491b-afc8-b77a1bb3dbbd","resolution":{"observed_at":"2026-08-07T15:37:07.667904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:07.814468Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.814468Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:8be44620d77036447475f81407f7573b322bed90233843171e0bcca6b14e8c8e","observation_id":"1b0b1f73-7306-42f7-8511-666ad68c556b","resolution":{"observed_at":"2026-08-07T15:37:07.814468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:15.609208Z","title":"End- to-end waveform utterance enhancement for direct evaluation metrics optimization by fully convolutional neural networks,","venue":null,"work_id":"ea032bff-d9d4-46b2-82ee-39b9ba60990c","year":2018},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:07.954577Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:ce1937921603f5bdd95a24ba912623e7f0653535942701a5ca06ac457e0b9459","observation_id":"5acb0750-94f2-4e87-adf7-fdb16a5598c5","resolution":{"observed_at":"2026-08-07T15:37:15.693897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:15.347017Z","title":"Generation-based target speech extraction with speech dis- cretization and vocoder,","venue":null,"work_id":"fe5b65b3-b8e4-4a3e-996d-f76567976fbb","year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.072375Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:35e0a597ca5a25a1c7d0da8178cc218f2d2d8c15a1672bae925d18282045eace","observation_id":"8b843759-e5ff-4bac-9168-9238a1e56fe8","resolution":{"observed_at":"2026-08-07T15:37:15.436054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:08.236236Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.236236Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:ae4c81cc4e6b906efbc409580d860a65dd819a1a799117bdb967256721863cb6","observation_id":"90e73fff-5718-4b6e-aba0-4497cbaaff4a","resolution":{"observed_at":"2026-08-07T15:37:08.236236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:08.370387Z","title":"Storm: A diffusion-based stochastic regeneration model for speech en- hancement and dereverberation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.370387Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:2971b19fe13eb940362dfe072f088542d83d00baf37d2f6bb2c5adb884237625","observation_id":"01cf691c-ff31-4bc6-a049-fda3fc609c6d","resolution":{"observed_at":"2026-08-07T15:37:08.370387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:15.095963Z","title":"Analysing diffusion-based generative approaches versus discriminative approaches for speech restoration,","venue":null,"work_id":"0481914c-7ff3-4fab-8957-9081ee2a89eb","year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.520357Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:d1486283d6f5a092408f323a25eae1dd140c804a901ed7a9eb4510289da94a2b","observation_id":"b270a7da-23f8-4c84-9ed9-d1195fa2ec16","resolution":{"observed_at":"2026-08-07T15:37:15.183329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:14.880025Z","title":"Conditional diffusion probabilistic model for speech enhancement,","venue":null,"work_id":"1aa93c06-cd27-437e-9d6e-d27863c06c9a","year":2022},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.613640Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:72b6f7b34a3ecf05c8db7e8a59d0b664d57765e0f9b80a354e222733447da304","observation_id":"0f01e56f-a955-414a-b73c-d649922a2b42","resolution":{"observed_at":"2026-08-07T15:37:14.937660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07841","last_updated":"2024-09-17T01:41:32Z","snapshot_observed_at":"2026-08-16T13:19:13.456476Z","submitted_at":"2024-09-12T08:41:07Z","title":"TSELM: Target Speaker Extraction using Discrete Tokens and Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07841","snapshot_observed_at":"2026-08-07T15:37:08.718742Z","title":"Tselm: Target speaker extrac- tion using discrete tokens and language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.718742Z"},"links":{"cited_paper":"/paper/2409.07841","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:81e4cfd442ca983259469110b7ecc527fe2f2ca33a1508c3c5d4c71095b77393","observation_id":"96162cac-8a45-4976-b043-ed847663fc3e","resolution":{"observed_at":"2026-08-07T15:37:08.718742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14477","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-14T04:23:08.371206Z","submitted_at":"2025-01-24T13:19:56Z","title":"Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14477","snapshot_observed_at":"2026-08-07T15:37:08.860549Z","title":"Enhancing intelligibility for generative target speech extraction via joint optimization with target speaker asr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.860549Z"},"links":{"cited_paper":"/paper/2501.14477","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:75bbc144f8c622234fa6dc1be727a0e0ca486f7f668f2592d5f05f1132f0d6de","observation_id":"df8b61db-204e-4fd2-b94b-825f583d3405","resolution":{"observed_at":"2026-08-07T15:37:08.860549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03987","last_updated":"2023-08-17T02:22:53Z","snapshot_observed_at":"2026-08-16T15:10:06.420842Z","submitted_at":"2023-08-08T02:06:11Z","title":"Target Speech Extraction with Conditional Diffusion Model","version":2},"cited_work":{"arxiv_id":"2308.03987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.03987","snapshot_observed_at":"2026-08-07T15:37:11.806524Z","title":"Target Speech Extraction with Conditional Diffusion Model","venue":"eess.AS","work_id":"8a687ced-9556-4428-ac17-840ef7783b3d","year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:08.971366Z"},"links":{"cited_paper":"/paper/2308.03987","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:631bfce34ecdbfa97b3e01a936854ccc3f2d0e92bb64128dc9437fb1d8a7a172","observation_id":"e30e3641-abab-493e-a89c-f71f40a454d8","resolution":{"observed_at":"2026-08-07T15:37:11.931469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T15:37:09.099875Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.099875Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:94bc975dd61025c43058a8038edd9c2edb58d5e9c3ed30e864c9e93644d66aa0","observation_id":"1b9e7d9e-db97-4f10-870a-f9543d921dcd","resolution":{"observed_at":"2026-08-07T15:37:09.099875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:14.735712Z","title":"Guided conditioning with predic- tive network on score-based diffusion model for speech enhance- ment,","venue":null,"work_id":"a651c8c9-5395-4f83-add5-8e5489a6944c","year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.234005Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:7695b24e16d810538a73477f0fceec61d6bc0a1dc7fa836de25ff48be867551a","observation_id":"3b7aa481-325d-44e0-ad27-e1cf9f2985dc","resolution":{"observed_at":"2026-08-07T15:37:14.786016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04826","last_updated":"2019-06-19T17:10:51Z","snapshot_observed_at":"2026-08-14T18:16:27.334746Z","submitted_at":"2018-10-11T02:57:14Z","title":"VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04826","snapshot_observed_at":"2026-08-07T15:37:09.365680Z","title":"V oice- filter: Targeted voice separation by speaker-conditioned spectro- gram masking,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.365680Z"},"links":{"cited_paper":"/paper/1810.04826","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:bf76ed2750bbce9c724e7f783d791e575791b3b147e7736d393fe6a1cc5028b2","observation_id":"25102226-6c02-4c11-ad2a-5d0b34580ed6","resolution":{"observed_at":"2026-08-07T15:37:09.365680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04686","last_updated":"2020-08-18T03:03:01Z","snapshot_observed_at":"2026-08-12T03:39:08.946505Z","submitted_at":"2020-05-10T15:00:07Z","title":"SpEx+: A Complete Time Domain Speaker Extraction Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04686","snapshot_observed_at":"2026-08-07T15:37:09.487247Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.487247Z"},"links":{"cited_paper":"/paper/2005.04686","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:7b7e0399cfcecef6eaae7a032c53e6650489af612467520e0697fcbfdba880ff","observation_id":"c1e64a72-212f-4436-b7f0-1b9da974a402","resolution":{"observed_at":"2026-08-07T15:37:09.487247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-16T15:27:27.142221Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-07T15:37:09.616746Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.616746Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:63c3b61ef64c41fcad3238d71a71027684204402792a3a86a9cb29533b9ae511","observation_id":"e3045518-e5d9-4e24-b1e7-6bfbecd78b09","resolution":{"observed_at":"2026-08-07T15:37:09.616746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T15:37:09.751461Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.751461Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:569a521564afc1b08748532da4f88b97855e57e0d65e0d6ca1141642470206ee","observation_id":"eb9005fb-6fbf-46eb-9ea2-9ecddd157e4a","resolution":{"observed_at":"2026-08-07T15:37:09.751461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:09.874400Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.874400Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:2b1c6a805d6c305a91f02c1d84134aa972234db3f34b70a5a7e9c5a3989dc84d","observation_id":"79b4be14-1ab5-4079-8ec3-d1018f3a8463","resolution":{"observed_at":"2026-08-07T15:37:09.874400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:14.505509Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":"5071bc9a-8b94-4514-962a-a8714996fd0b","year":2021},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:09.998685Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:f85330d1432fffd4587543a7797ebae81dcca52e7ebf9a107122a81cead9360f","observation_id":"2c779261-10f0-48ff-8466-d7fa2ce9e229","resolution":{"observed_at":"2026-08-07T15:37:14.595175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:14.214377Z","title":"A convnet for the 2020s,","venue":null,"work_id":"5718488c-4596-4013-aec1-4ca27a47ec29","year":2022},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.116704Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:349e48d6f88bba9c207d0863f5ec9821390dc18942c51acb935f0c4c9d2dee45","observation_id":"528d1f37-bda9-4440-9cfb-0f4b7cec4fe5","resolution":{"observed_at":"2026-08-07T15:37:14.362096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:13.947685Z","title":"Separate and diffuse: Using a pretrained diffusion model for better source separation,","venue":null,"work_id":"bac3d196-657d-4b96-9305-f62d8ac6bc78","year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.160762Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:d113bcb2695f9c1a0293e1108f8ee60af831b401ced6c2a7a33595356a4b2b5d","observation_id":"630f67cb-d95f-42a8-a620-a8c821c08aa7","resolution":{"observed_at":"2026-08-07T15:37:14.086893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:10.245812Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.245812Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:02c8cedb4c3032a5ee7e6f672e735e49b88b404912180191d2a4c737f2d026c3","observation_id":"3fbafaaf-cc88-47d7-aafa-69af07e55a6f","resolution":{"observed_at":"2026-08-07T15:37:10.245812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:10.366497Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.366497Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:56c52f82bdefbefb52e9fcfae34e413ad3ccb53f6c4bd8524bd52a9ccf61c158","observation_id":"aff68958-d781-493a-aa86-a582031583c8","resolution":{"observed_at":"2026-08-07T15:37:10.366497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:10.474067Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.474067Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:4f649c59c9d37b556682384a3a90f757c65594cb0f5432e5c88834a3de0af307","observation_id":"ec3b3f18-def2-404f-a6d0-4e216076aaf7","resolution":{"observed_at":"2026-08-07T15:37:10.474067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:13.614531Z","title":"Diffusion-based generative speech source separation,","venue":null,"work_id":"0fbe47c7-7acc-4919-9671-8f629148ebba","year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.595249Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:7a7b3a9e208c32d229599af18e22fe8ed90131eafceed38556aef91ac8b5ee38","observation_id":"e336c349-c522-4232-ac2e-e460330da162","resolution":{"observed_at":"2026-08-07T15:37:13.750025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:13.358386Z","title":"Dpccn: Densely- connected pyramid complex convolutional network for robust speech separation and extraction,","venue":null,"work_id":"c08da91b-ad38-49eb-bb46-473ebacacd86","year":2022},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.740300Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:9042a85b0343df08d37720a7dba3fc1e4a1097272a0389124569617ec0b67da4","observation_id":"c24e3fd2-38f6-43f6-9d8d-1b6e288384da","resolution":{"observed_at":"2026-08-07T15:37:13.474190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:13.091212Z","title":"Personalized speech enhancement combining band-split rnn and speaker attentive module,","venue":null,"work_id":"a739daea-e339-4afe-918e-cd66fd83f1f2","year":2023},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:10.840587Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:2b3d96c9923e136ac7c393bd3e2927e5dacc8865cb67029b30af1f52c9424492","observation_id":"9009b72f-b28a-401e-b490-469514c2d27b","resolution":{"observed_at":"2026-08-07T15:37:13.216644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T15:37:11.011218Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:11.011218Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:fe2648085416507e1fde493329d1def96eeced8b176e0581aae56efe05d88c69","observation_id":"17d73f96-4f7c-4b3e-97c1-e0e68d0b14de","resolution":{"observed_at":"2026-08-07T15:37:11.011218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:12.853450Z","title":"Diffusion-based speech enhancement with a weighted generative-supervised learning loss,","venue":null,"work_id":"7f3b53de-5365-42f9-91b9-75ede010ee6a","year":2024},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:11.109244Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:cce402f40492cf2c400568a7591a4b64ea1fad2426472124392a4f55e4eb1dd0","observation_id":"5588fc1f-2901-4527-b603-6bd0d7b28347","resolution":{"observed_at":"2026-08-07T15:37:12.975161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.00264","last_updated":"2020-09-23T03:16:28Z","snapshot_observed_at":"2026-08-14T07:21:56.171937Z","submitted_at":"2020-08-01T13:42:29Z","title":"DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.00264","snapshot_observed_at":"2026-08-07T15:37:11.184347Z","title":"Dccrn: Deep complex convolution re- current network for phase-aware speech enhancement,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:11.184347Z"},"links":{"cited_paper":"/paper/2008.00264","citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:34d3c2cf75a43eab42efcc55caebbfdeec784f9cfd1f43922cfbc1de40a2cba4","observation_id":"41e3b8c9-ca5d-42ea-b651-2182f4a7f135","resolution":{"observed_at":"2026-08-07T15:37:11.184347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:12.620316Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"7fbec386-626f-474a-bc39-fb5fbb84f589","year":2001},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:11.230489Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:b426a7b3c7f34a3078ca611cd6064aadb7e8fc31ef8998ea024b997e9d2680d7","observation_id":"3546a637-5d97-43f3-ac1b-3d1c8c978b62","resolution":{"observed_at":"2026-08-07T15:37:12.746930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:12.358451Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"9e18e8da-8ae7-4125-9e09-c824229b72f6","year":2010},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:11.321623Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:5b49d7469ff035c330a376e83d6d084def516388d850370c99d4a6649fd5e69c","observation_id":"5562600a-ef49-42b2-b8ff-385b5b2fa653","resolution":{"observed_at":"2026-08-07T15:37:12.499948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:37:12.131641Z","title":"Dnsmos p. 835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"8b96ca90-6dcd-48eb-a25b-1b68cf90e59d","year":2022},"citing_paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:37:11.459923Z"},"links":{"citing_paper":"/paper/2505.14465"},"observation_digest":"sha256:7ce1b5db25f9343e3dc758ec7208e47775649655da014bb99b86e38f1b7ecc57","observation_id":"b92ef756-58b1-430e-a6db-e6dfc6c0a9d9","resolution":{"observed_at":"2026-08-07T15:37:12.242327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14465","last_updated":"2025-05-20T15:01:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T15:36:48.584508Z","submitted_at":"2025-05-20T15:01:30Z","title":"FlowTSE: Target Speaker Extraction with Flow Matching"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2505.14465."}