{"as_of":"2026-08-10T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27d4dfec80d6b265c722c13053df02d536b73330baa6d9a09eb317e97d36d246","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:36:19.265120Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:36:14.939053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T12:36:19.393272Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"cited_work":{"arxiv_id":"2507.21642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21642","snapshot_observed_at":"2026-08-06T12:36:19.393272Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","venue":"cs.SD","work_id":"7be0e27d-1854-47e0-bbee-e1cb8e1d5c8d","year":2025},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.939053Z"},"links":{"cited_paper":"/paper/2507.21642","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:5a20e7e09f17ca012f8db595d5beebde933e95c844d9fe1685a74e385aa779d9","observation_id":"d39270fe-4d4d-49d2-aa0c-7197b77f5b29","resolution":{"observed_at":"2026-08-06T12:36:19.486175Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21642/citation-record","integrity":"/paper/2507.21642/integrity","json":"/paper/2507.21642/citation-record.json","paper":"/paper/2507.21642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.344771Z","title":"In-the-wild (ITW) refers to data that is not recorded or collected in a highly controlled environ- ment [1]","venue":null,"work_id":"ad0911f1-e2bf-4ce7-a374-020788552899","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.694066Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:70af7fd92a4326b81368553d0a8031b2dfa67faa034dbb7df788b3223ed76e3c","observation_id":"0d7fdc80-86a8-45d4-8f83-7ff408980450","resolution":{"observed_at":"2026-08-06T12:36:20.347827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"cited_work":{"arxiv_id":"2507.21642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21642","snapshot_observed_at":"2026-08-06T12:36:19.393272Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","venue":"cs.SD","work_id":"7be0e27d-1854-47e0-bbee-e1cb8e1d5c8d","year":2025},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.939053Z"},"links":{"cited_paper":"/paper/2507.21642","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:5a20e7e09f17ca012f8db595d5beebde933e95c844d9fe1685a74e385aa779d9","observation_id":"d39270fe-4d4d-49d2-aa0c-7197b77f5b29","resolution":{"observed_at":"2026-08-06T12:36:19.486175Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.317126Z","title":"For the first training stage, simple filename and label pairs are derived from non-ITW datasets","venue":null,"work_id":"f62b751b-5b9f-4c77-b39e-f2023656340e","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.203573Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:7c46eba4d0d6d962d6887c4cca6b4877353eea0a7102474b6f8538618a14e3a1","observation_id":"3d8a8247-85f7-42fe-9e62-1715c538b78f","resolution":{"observed_at":"2026-08-06T12:36:20.320435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.308429Z","title":null,"venue":null,"work_id":"8dcf3f18-c6a1-4155-a72e-e799c12d961d","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.367337Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:649dad35bfa828c182d4e964453d7cc9722708b8c3b539b4b591fbe8b2149541","observation_id":"deb1ed1e-34e7-4258-87eb-c7cb1c86c98d","resolution":{"observed_at":"2026-08-06T12:36:20.311411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.299381Z","title":null,"venue":null,"work_id":"58113d2a-505e-4a95-97fe-51bfb29c514a","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.474633Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:ade71ed46b0d1e7a7c078cd2f969ebc27f617e297abd0070c3f4c3fae03731d6","observation_id":"18f3e325-9386-4531-9dd6-f7eb3020ba32","resolution":{"observed_at":"2026-08-06T12:36:20.302330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.290309Z","title":"noisiness","venue":null,"work_id":"71b08c82-7fe6-4213-ba67-300f9825b368","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.633256Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:6dc8c9b4d9fba1fb80608b8f5dcf420b8d31a1a9bb76f3fae10ffb3df959945e","observation_id":"b202d257-f806-44c3-a2b5-8e725b0e3ef8","resolution":{"observed_at":"2026-08-06T12:36:20.293300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.280469Z","title":"It was shown that the AITW dataset can be used to train classifiers on multispeaker, foreign language, background music, noise and synthetic speech labels","venue":null,"work_id":"5244bbc4-a89b-4688-984a-311fdd01ccf4","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.759015Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:2864de5166c98a425ea80bd80f9fa370d2b8bf3219bdcefb89c498de0400a2c6","observation_id":"0eab6f77-b80c-489d-b6d9-13c2aa1b0544","resolution":{"observed_at":"2026-08-06T12:36:20.284045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.210024Z","title":"An open-source speaker gender detection framework for moni- toring gender equality,","venue":null,"work_id":"f644ee9e-9c92-4c09-a8c8-768c134c2182","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.012882Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:bf5ef6a84d1d95e273b87aa9803d139ed8932858c31b37cf747221b7e1484c53","observation_id":"662c5dbe-1be9-445e-801f-2669df316465","resolution":{"observed_at":"2026-08-06T12:36:20.213158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.200863Z","title":"Label Studio: Data labeling software,","venue":null,"work_id":"aaeb50b1-7d87-423f-8827-c33e8cd3f1cb","year":2020},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.188737Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:238675db21c0796af84efa581c0b945cbfa82c74fbdbcf0e11d44d209785de97","observation_id":"f66a5262-6e0e-4108-a8df-557f08781bcd","resolution":{"observed_at":"2026-08-06T12:36:20.203845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.271125Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":"72b1f064-9b00-4364-af20-f1d2c372f6b4","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.952302Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:7bd73379015bef157b6a566f0c1c02f3aeea45d60a5ebf6e1f9d58335a3e4f0f","observation_id":"80080ab1-ade4-4845-89ee-65c9459317ce","resolution":{"observed_at":"2026-08-06T12:36:20.274372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.260331Z","title":"YODAS: Youtube-Oriented Dataset for Audio and Speech,","venue":null,"work_id":"94655b14-8fac-44f1-93ec-dc99408382bd","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.062098Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:48f6af747518651b7f9eba558a84e2d5d8ba3bc94f220829d81fff6ed8653d53","observation_id":"7f0c58ca-f948-4e55-ad21-a87f4cf104a9","resolution":{"observed_at":"2026-08-06T12:36:20.263840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T12:36:16.250981Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.250981Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:f0627dd55c32ff613c64557c71cf59ae0bf2cdcf4eec5e2365ae37817744b136","observation_id":"d4a39cdd-a493-4d96-90f3-f2082407f8dd","resolution":{"observed_at":"2026-08-06T12:36:16.250981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.249642Z","title":"Speak, read and prompt: High-fidelity text-to-speech with min- imal supervision,","venue":null,"work_id":"50e8efb0-7ecc-4561-a87d-99d5412219c4","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.377864Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:e8039cbde4432cefc2fbfd50cb25d7d0c2332860d32b8eb91d023f6b77bef257","observation_id":"d42dd31b-d7a2-4b0c-ac1c-20430aa0225f","resolution":{"observed_at":"2026-08-06T12:36:20.253100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.335726Z","title":"synthetic speech and non-target languages in many cases)","venue":null,"work_id":"aa20aceb-bda3-489b-b092-063f121ec7b0","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:14.761813Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:7900ba34e3e4c03f89a57d51972a9ca422616ab78b0b8c609ce5642ed9b4992a","observation_id":"4e3daa7b-011d-4649-8449-6688a6aeeeb6","resolution":{"observed_at":"2026-08-06T12:36:20.339065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.238780Z","title":"mhubert-147: A compact multilingual hubert model,","venue":null,"work_id":"0efd53e4-2959-4c3e-8c68-dd0fb3dea9ad","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.582222Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:fbb938b667ba0784e176647a2434da5760ab6e1bf957490423f191826284ae15","observation_id":"788c4853-3cc5-42c1-b3fe-f9e889214510","resolution":{"observed_at":"2026-08-06T12:36:20.242353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.228902Z","title":"Sentence level intelligibility eval- uation for mandarin text-to-speech systems using semantically unpredictable sentences,","venue":null,"work_id":"d264e554-1b1b-461e-8ed8-fd856e5cb009","year":2007},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.739548Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:90376c13e19113317a02029b3414d9a67c043b84294580c4d14b9df0490d6e86","observation_id":"3a99ca04-b170-4b91-9a1c-1a49d79b0ac9","resolution":{"observed_at":"2026-08-06T12:36:20.232020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.219482Z","title":"Data-filtering methods for self-training of auto- matic speech recognition systems,","venue":null,"work_id":"c0949fce-44c6-4354-9f91-820b1d556950","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.856553Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:20d850c739216da49ecb59020251e40b8b2a49cd56b128c403b603437b3967f7","observation_id":"8095009c-91eb-4157-b76f-2d882ec09be2","resolution":{"observed_at":"2026-08-06T12:36:20.222623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.023303Z","title":"Attention is All you Need,","venue":null,"work_id":"ee1daff2-1141-481c-970b-40d499faa6d6","year":2017},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.993141Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:fc59ca70c90f321e7dbb5efecb9db70257580da3125330dbd67ed6a8550c37b2","observation_id":"dfd21f4b-5d2b-4ef0-ac35-e1014274d4fb","resolution":{"observed_at":"2026-08-06T12:36:20.026366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.097745Z","title":"pyannote.audio 2.1 speaker diarization pipeline: prin- ciple, benchmark, and recipe,","venue":null,"work_id":"8016c9d4-8fbc-4933-ad24-e0629419db81","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.257923Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:6244703ed2965a356d5f2cc4ea771f33965d06aa27a0a9891d416aa1748c5eda","observation_id":"b9c5a3b8-08c8-40f9-9502-6c92053cb87b","resolution":{"observed_at":"2026-08-06T12:36:20.194492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.089352Z","title":"FoR: A dataset for synthetic speech detection,","venue":null,"work_id":"e7225bfe-b76d-41d2-a4cc-fcd6b1632ca8","year":2019},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.347739Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:444b8da381bb9aafcc7dda77696fa6980b44037ecedf312ec56fe2820dbe4112","observation_id":"6c8d09a5-d94e-415b-ae78-4a814d3773de","resolution":{"observed_at":"2026-08-06T12:36:20.092229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.080273Z","title":"AASIST: Audio Anti-Spoofing Us- ing Integrated Spectro-Temporal Graph Attention Networks,","venue":null,"work_id":"abac8eb6-a252-423b-8767-70939191b4b5","year":2022},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.436804Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:e174afdf6a61d2ce26a2b9633166904e4ec1018c9c05a5cd131521f460a3ac25","observation_id":"9a699321-9cf0-4061-93d0-a07c96283c51","resolution":{"observed_at":"2026-08-06T12:36:20.083301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.326373Z","title":"This as- sumption is validated later in our results, cf","venue":null,"work_id":"496f6d25-97b0-4bc5-b70b-14a64a4d35a2","year":null},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:15.048489Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:f19456f66573721e24edd63a83521ae884e95a4a67559e5dc46af8bc90641eba","observation_id":"d2e535ba-d3a9-4939-8abf-99a1931349bd","resolution":{"observed_at":"2026-08-06T12:36:20.329846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.070650Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"3c35ea3a-f4a7-4a91-b01a-0ad7285a765b","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.518641Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:3d64e1bc629c48203a8ff49de07bbdfce13043309a7a7757d5745307037d7780","observation_id":"431ed380-c6a3-4748-9ba2-f678217b81d3","resolution":{"observed_at":"2026-08-06T12:36:20.073766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.061320Z","title":"Perceive and predict: Self-supervised speech representation based loss func- tions for speech enhancement,","venue":null,"work_id":"df3574db-ee99-4b6e-aa27-0b150c881304","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.608036Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:f5cf089e1df3390f68734bf420fa6a9aa3fcd424507ee65832c89160cc1b18d8","observation_id":"7a73256a-16f2-4004-b601-e7a39733765d","resolution":{"observed_at":"2026-08-06T12:36:20.064610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.051826Z","title":"Transcription-free fine-tuning of speech separation models for noisy and reverberant multi-speaker automatic speech recognition,","venue":null,"work_id":"7da7b6f1-86b4-4d3c-8b32-b8356d815aa7","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.687623Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:e55ed5893ede39dd4e35b1fbf0c42555f970e27f80a4e7f3d9624c2889835f53","observation_id":"1d4fe041-0f67-4bbe-9392-c30dc86605ce","resolution":{"observed_at":"2026-08-06T12:36:20.055009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.042184Z","title":"Non-intrusive speech intelligibility pre- diction for hearing-impaired users using intermediate asr features and human memory models,","venue":null,"work_id":"5e2b3b48-0f17-4880-855b-e341d7d4f0c4","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.818034Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:0d13b702d5a719ff59ee248a993838afdab5a35f31d6970f51ec54842dd40b98","observation_id":"4bd74790-bffe-434a-8f27-88d484b90167","resolution":{"observed_at":"2026-08-06T12:36:20.045407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.033125Z","title":"Heterogeneity over homogeneity: Investigating multilingual speech pre-trained models for detecting audio deepfake,","venue":null,"work_id":"b4757f05-c04e-406c-99d8-ed437dd83071","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:17.904511Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:156078958e9571582989537778af1eaa38f11ea3da7282e334222c7152d8ed37","observation_id":"9a794ed0-4674-4f02-afdc-075e8d938a42","resolution":{"observed_at":"2026-08-06T12:36:20.036295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.012746Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality pre- diction with crowdsourced datasets,","venue":null,"work_id":"4679ddc4-cafa-4045-afc4-d84e879849dd","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.073975Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:45a5d190e0a93a180459ce27284a20426e21a513b7648ca23cce847c2d74f7df","observation_id":"f78d6fe7-9e8c-4e81-9b18-d2446077e1d7","resolution":{"observed_at":"2026-08-06T12:36:20.016269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:20.001982Z","title":"Hallucination in perceptual metric-driven speech enhancement networks,","venue":null,"work_id":"4ad891f2-2b57-4f65-94d8-7d41493c5d67","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.121425Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:526fd286c1075bf63d445e47e145b20c7c8c648debce28733b24ae88ba87f42b","observation_id":"19dd9b2a-49d7-4688-a944-9e8599a75257","resolution":{"observed_at":"2026-08-06T12:36:20.005475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.991392Z","title":"An overview of multi-task learning in deep neural networks,","venue":null,"work_id":"15258b53-d4a8-48e8-ac94-e23e3d73edc4","year":2017},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.183181Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:e78e34b1cdc66d8273fe437e55f86ccefc5f53713e5cbc73fc4806e81eb0a90c","observation_id":"e2518e7a-a00f-478f-abe5-525e202aa34b","resolution":{"observed_at":"2026-08-06T12:36:19.994398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.982355Z","title":"BEATs: Audio pre-training with acoustic to- kenizers,","venue":null,"work_id":"7be0b56f-c4e4-4935-ae9a-607cc889b077","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.246729Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:92ac50a5daa389426930672f199d3c26a5b3467bea0c8b840ebda182c47e91a4","observation_id":"05818646-6738-4a57-9ddd-199d562323d4","resolution":{"observed_at":"2026-08-06T12:36:19.985310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.972772Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"af3c457f-5483-409b-b714-c75fac220e13","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.331090Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:c5f03e38c7fb1e0e85a1824f7e75e69af82ce642ecfac37c220eedeb0f2829ce","observation_id":"aebc4646-88f0-4a16-b3e8-57bcbf75fec7","resolution":{"observed_at":"2026-08-06T12:36:19.976010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.963233Z","title":"Wavesplit: End-to-end speech separation by speaker clustering,","venue":null,"work_id":"13ee3c36-9f64-47f6-bd6e-acde65d120f0","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.453605Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:79a67343c6a3494767af2b10b65ba3a665446c71a98300dc79900ab2b2941eb4","observation_id":"014a8bb2-4168-48c3-a442-168f1bee4121","resolution":{"observed_at":"2026-08-06T12:36:19.966245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:18.476532Z","title":"The AMI Meeting Corpus: A Pre- announcement,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.476532Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:60865942c9457576dadd3e0e4ae7486e3a0ef9e128c88d4b902b6daa556dec8c","observation_id":"fb1510eb-4c64-47b5-aada-3fdee4d7de85","resolution":{"observed_at":"2026-08-06T12:36:18.476532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.946872Z","title":"M2Met: The ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Challenge,","venue":null,"work_id":"3af4b062-c5f3-4340-a7a2-445c61cfcce8","year":2022},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.591304Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:42fefd280ca925296bb9956b61b6d799af58b4d59a7f0b13d3eba8e4933e9285","observation_id":"e2ccdfa0-b169-4d5b-b4b3-0a34d3d08f00","resolution":{"observed_at":"2026-08-06T12:36:19.950665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.937204Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research,","venue":null,"work_id":"6497e772-4331-467f-8795-e62dd189d5bf","year":2020},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.612570Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:470a5b1e8e8fcdde0347f06d4f37c97c81d3ab45d98f7f97dce80eebcb225b7e","observation_id":"5a0b28c5-50c1-44f0-bc0d-ddb1dd0f03e8","resolution":{"observed_at":"2026-08-06T12:36:19.940318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-06T12:36:18.698419Z","title":"MUSAN: A Music, Speech, and Noise Corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.698419Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:a9069e614a6cb9e18c553a96a0c5e119e05516f2e53ba25013ca5ed9c74c4dc8","observation_id":"79768340-eee1-4774-b730-8ef1af09d142","resolution":{"observed_at":"2026-08-06T12:36:18.698419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.927345Z","title":"An open dataset of synthetic speech,","venue":null,"work_id":"e27957a2-4470-4961-b440-4f30c65102c2","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.763442Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:a84819e8ff7d3b1f98b92dc71ac7a54edf0b16db80ef801caa4327a5ed942b4a","observation_id":"153e9b18-4ea5-417b-b93c-d74ff886df1b","resolution":{"observed_at":"2026-08-06T12:36:19.930422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.917693Z","title":"OpenMIC-2018: An Open Dataset for Multiple Instrument Recognition,","venue":null,"work_id":"7157b2d2-fff5-4707-8260-95ac075822d1","year":2018},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.817911Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:3316b34c5b4fe9f1f376fb5b9a8017ca7d49fec4024d5e709e9d79215cef706c","observation_id":"3d43015b-4aec-426c-a567-8d67381e9d58","resolution":{"observed_at":"2026-08-06T12:36:19.920880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.907771Z","title":"Learning sound event classifiers from web audio with noisy labels,","venue":null,"work_id":"014effb1-0ef2-4825-bcc0-8a4108ce0c4e","year":2019},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.927422Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:cd9f8f8f85d405b123205ebf4f47916d9781877670d414682abe34225cf7d8f1","observation_id":"94bc4d53-bd70-44fb-8698-49640fe024cb","resolution":{"observed_at":"2026-08-06T12:36:19.910904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.897244Z","title":"The Diverse Environments Multi-channel Acoustic Noise Database (DEMAND): A database of multichannel environmental noise recordings,","venue":null,"work_id":"a3b7de0f-0706-4991-a413-70405f1d376e","year":2013},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:18.964872Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:011fd5df38b39dea5c2576372ac62e0aa60d6261ce0233b16d39533990b03d2a","observation_id":"071634a6-5ab4-47b2-82e3-4d333f345586","resolution":{"observed_at":"2026-08-06T12:36:19.900996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.886261Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":"5e2a26a6-7e07-4412-9354-fff2f074343a","year":2015},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.040456Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:7bf9a182ccd8d446b14a2c2e0d69afb7c5a5a57c6f94e230b08e865efd3680f4","observation_id":"1bd364b6-7016-4a1a-b27a-88cae80a4116","resolution":{"observed_at":"2026-08-06T12:36:19.890136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.876671Z","title":"Data augmen- tation for speech separation,","venue":null,"work_id":"cb68dafd-db82-4721-9db8-4b47bce57729","year":2023},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.120411Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:f45d94a3921769b8cc3d0aceed92b614cc55f3da49e7903e203a9e0b85a7b6f3","observation_id":"a5aa999c-6a45-46ea-9f94-54606eccca78","resolution":{"observed_at":"2026-08-06T12:36:19.879696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.866657Z","title":"Dnsmos: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"e0a18a92-18c8-44e0-b921-a35965d21300","year":2021},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.139425Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:732180721d42fafc516427c84d6a8800ce31bc922f9968e0f3ea1679801500ea","observation_id":"e52c97ed-3e81-4024-aec6-8138acbdf9b0","resolution":{"observed_at":"2026-08-06T12:36:19.870112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.783007Z","title":"Convolutional recurrent neural networks for poly- phonic sound event detection,","venue":null,"work_id":"3c9c66fd-77d3-4032-be59-bdf9108ed621","year":2017},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.156870Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:4ebd1f64ce32442a00e55b71ccfa2c8d05880692b9fb618e41b41fa7b8e41e75","observation_id":"9b35680e-7f3d-4ca2-95a1-ec19dc7d79f5","resolution":{"observed_at":"2026-08-06T12:36:19.834641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:36:19.586542Z","title":"Mlaad: The multi- language audio anti-spoofing dataset,","venue":null,"work_id":"8e9b145c-0f1b-4b06-b50e-5eed0ed74351","year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:19.265120Z"},"links":{"citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:3ace42663946b294e1b9902d74256771d4d35947573d3bea2dc6715c432a312b","observation_id":"2a14e91f-c44d-491f-ab8d-9d88d3921049","resolution":{"observed_at":"2026-08-06T12:36:19.652398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T21:10:08.060777Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2507.21642."}