{"as_of":"2026-08-21T13:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:599c6e2584533b4dba2b307a080bebd63d2844f9d7cc79d94488b5bd8e801de2","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:05:25.940672Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:58:02.481574Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T14:24:45.592114Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12512","snapshot_observed_at":"2026-08-15T16:58:02.481574Z","title":"Libri2V ox dataset: Target speaker extraction with diverse speaker conditions and synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19210","last_updated":"2025-08-26T17:15:42Z","snapshot_observed_at":"2026-08-18T03:36:40.249362Z","submitted_at":"2025-08-26T17:15:42Z","title":"Interpolating Speaker Identities in Embedding Space for Data Expansion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:58:02.481574Z"},"links":{"cited_paper":"/paper/2412.12512","citing_paper":"/paper/2508.19210"},"observation_digest":"sha256:10093d0d0a78de717cb0deac83ffaada4e72d499b45d3f2ea2d967e1c2dfca09","observation_id":"ff96ee8b-2756-4927-82cc-6de689893135","resolution":{"observed_at":"2026-08-15T16:58:02.481574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"cited_work":{"arxiv_id":"2412.12512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12512","snapshot_observed_at":"2026-06-30T14:24:45.592114Z","title":"Libri2vox dataset: Target speaker extraction with di- verse speaker conditions and synthetic data,","venue":null,"work_id":"1b42a7b3-e5f7-4917-a917-2660b1f024d4","year":2024},"citing_paper":{"arxiv_id":"2606.29897","last_updated":"2026-06-29T07:34:06Z","snapshot_observed_at":"2026-08-21T10:25:45.180079Z","submitted_at":"2026-06-29T07:34:06Z","title":"Child-Centric Voice Anonymization in Single and Multi-Speaker Speech via Domain-Adapted SSL Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T05:26:46.541637Z"},"links":{"cited_paper":"/paper/2412.12512","citing_paper":"/paper/2606.29897"},"observation_digest":"sha256:45075e73caf219758fed9f2fbdf834811468ee71ab286afacda286e063cef9ca","observation_id":"8503687a-c68d-471e-8c66-def7496542be","resolution":{"observed_at":"2026-06-30T14:24:45.594078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12512/citation-record","integrity":"/paper/2412.12512/integrity","json":"/paper/2412.12512/citation-record.json","paper":"/paper/2412.12512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.747601Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"5c8cc058-692b-4c3b-9d88-2ce6895d43d8","year":2023},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.702675Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:12549e124cc9b856762e01179367b5b0aaf88bbaa038f8deb446bebc2c52103f","observation_id":"19b250f4-bbc9-49f6-8971-e1667a6e15f7","resolution":{"observed_at":"2026-08-11T14:05:26.751756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.734176Z","title":"Speech separation with pretrained frontend to minimize domain mismatch,","venue":null,"work_id":"e4d913d4-b1e3-4898-bf63-1407efb05106","year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.707581Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:2d9f4dc088989691ebcf20458dde7cd3736372abbdcc24222fee2456d54230ff","observation_id":"be20176c-dc09-4550-a0b7-0238337c6f35","resolution":{"observed_at":"2026-08-11T14:05:26.738211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.721195Z","title":"Spex: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"42ef3138-b90d-4bd6-890d-46c53f965079","year":2020},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.711986Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:f728371325fd7f2be4e719dd62c92d3b7f5bd437bdc3880d656a56f4c96569a2","observation_id":"3961b256-2393-4ed4-9444-dc071ccb6b22","resolution":{"observed_at":"2026-08-11T14:05:26.725395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.707359Z","title":"Spex+: A complete time domain speaker extraction network,","venue":null,"work_id":"3d2b65d6-6b62-4d23-9eb6-11609eb99415","year":2020},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.716431Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:637e5d13c38383fa77f93c38e979f331acfbdf3046f4d176d8ed4b6a49b75822","observation_id":"f491bc91-3d51-4ea3-bbaa-75fec09f2183","resolution":{"observed_at":"2026-08-11T14:05:26.712160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.693571Z","title":"Target speaker verification with se- lective auditory attention for single and multi-talker speech,","venue":null,"work_id":"672003fb-4af5-434d-9f68-b0e967fd1e16","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.720684Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:d90f5ef910329e58cb1992253fb634f0fef4359cee598e55ea857170eb14e52b","observation_id":"09d2fa82-48e0-443b-934c-266b32585615","resolution":{"observed_at":"2026-08-11T14:05:26.698216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.679399Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":"d5e344d2-c4b3-4814-9dcd-678d878ce675","year":2018},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.725194Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:6f3b77cdfb22fc53cb920b311dcb21d65adab90f718327e01561669ccacc1b13","observation_id":"be92ded4-772c-4814-8355-db5d3b23a9e6","resolution":{"observed_at":"2026-08-11T14:05:26.684196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.665020Z","title":"LibriTTS: A corpus derived from librispeech for text-to- speech,","venue":null,"work_id":"ec3ae3f5-e450-43ec-922d-b6ac7cee34af","year":2019},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.730017Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:46ed549d0b7d68b27861e47a329a7b5286cab556539181be19fdeced3975eb49","observation_id":"5402311e-22b6-4b1c-a716-8762526b6352","resolution":{"observed_at":"2026-08-11T14:05:26.669640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.650419Z","title":"LibriSpeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"96c7e6c1-7d89-40df-a6c9-e5938bb7484f","year":2015},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.733998Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:fdb18808a8f11107de583af08a8a245c2168205b5d6d496a80af3311586f8e41","observation_id":"efc50805-be03-43fb-91f4-e11d6ea6c955","resolution":{"observed_at":"2026-08-11T14:05:26.655365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04062","last_updated":"2025-04-04T09:34:37Z","snapshot_observed_at":"2026-08-18T16:42:16.821528Z","submitted_at":"2023-02-08T13:59:31Z","title":"Machine Learning for Synthetic Data Generation: A Review","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04062","snapshot_observed_at":"2026-08-11T14:05:25.737993Z","title":"Machine learning for synthetic data generation: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.737993Z"},"links":{"cited_paper":"/paper/2302.04062","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:055fb438af6717b78b664232a548b0a207d4b5a76e8235f8335484fe004a157e","observation_id":"e86aba8e-439f-454c-9f28-f12d5591fe2d","resolution":{"observed_at":"2026-08-11T14:05:25.737993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.636226Z","title":null,"venue":null,"work_id":"46dc6848-a115-4707-9b12-0f5c3211983a","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.742359Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:155386b8a853c04f563a17c685f2b4c9927de93155a21d897800732b377beb9c","observation_id":"8985dcd2-17ca-41a7-a31e-d7633fc9338e","resolution":{"observed_at":"2026-08-11T14:05:26.640832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.621778Z","title":"What makes good synthetic training data for learning dis- parity and optical flow estimation?","venue":null,"work_id":"048e79f6-98c7-4355-b944-2f5c8fa4d3d8","year":2018},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.746171Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:52bff51c5c6f011e31b6a001f91a3344a05ac7b8519c78edde5680af1c532ed8","observation_id":"f699387c-056d-46b3-9eca-131c26961bd9","resolution":{"observed_at":"2026-08-11T14:05:26.626515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.603007Z","title":"Deep learning-enabled medical computer vision,","venue":null,"work_id":"b752bd3d-861f-432b-82fe-e278acbeb379","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.750681Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:04b66d6273d9080cb4870ecdceadb228462d524c1c7d977988206b834920ab44","observation_id":"39b4c628-81e1-48bd-8bbb-7d4820bc7724","resolution":{"observed_at":"2026-08-11T14:05:26.607128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.589100Z","title":"Data augmentation for low- resource neural machine translation,","venue":null,"work_id":"da5ad6de-e86c-4b0f-92c6-1dbd743b1b27","year":2017},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.755219Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:f5ed032518fd1a714b308fd760aaf134f53e7f543d9b88adf3d86bb73b1b7d41","observation_id":"cf96305f-aa52-49fa-9d75-1d3cc51da5f3","resolution":{"observed_at":"2026-08-11T14:05:26.593384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.575622Z","title":"A survey of data augmentation approaches for nlp,","venue":null,"work_id":"ed10b663-c6b9-49be-84f8-c049bd4c8584","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.759531Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:80da774d8e24af87dc2271ab4a62dedfa9b17f5ef6ec5421b6d12753885d4bf0","observation_id":"42e86da4-6763-4692-8cee-6ba6485242e4","resolution":{"observed_at":"2026-08-11T14:05:26.579956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12896","last_updated":"2024-10-16T16:12:39Z","snapshot_observed_at":"2026-08-20T11:08:10.891819Z","submitted_at":"2024-10-16T16:12:39Z","title":"A Survey on Data Synthesis and Augmentation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12896","snapshot_observed_at":"2026-08-11T14:05:25.763909Z","title":"A survey on data synthesis and augmentation for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.763909Z"},"links":{"cited_paper":"/paper/2410.12896","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:aa99bc73cf2527fb8f5cf709e8acd5a5161cc960b5b620f52b33373ac761f205","observation_id":"1012f1fd-2c6e-4cb2-8a2b-4440191e488d","resolution":{"observed_at":"2026-08-11T14:05:25.763909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.561754Z","title":"SYNT++: Utilizing imperfect synthetic data to improve speech recognition,","venue":null,"work_id":"a9737f7f-2c01-474c-a963-762118978967","year":2022},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.768611Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:a448f140edfc58964c99c3a4907a5b9708f0d9fa995063da362fab95ec882653","observation_id":"c71a945b-80a6-4d9d-9a53-c52991619646","resolution":{"observed_at":"2026-08-11T14:05:26.566353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.547115Z","title":"SynthASR: Unlocking synthetic data for speech recogni- tion,","venue":null,"work_id":"ff4ce7ec-b1e1-4c82-9a19-d4b76cb38b46","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.773119Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:6bd6a31531bab50dab0bce65c4272031a30a8588e48eed71f4e621dfdaf8de64","observation_id":"a8b35c9a-e69a-4c40-bde6-33bf290bf0c3","resolution":{"observed_at":"2026-08-11T14:05:26.551974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.532011Z","title":"Effective data augmentation methods for neural text-to-speech systems,","venue":null,"work_id":"c2f42801-22da-4ab3-b26d-e936180a3f6d","year":2019},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.777524Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:2212bc50e211ebcd1ad9c3c0c3d3daa30dfe24df5fb3ebc430e260c124e651ef","observation_id":"f20d2363-edaa-44b1-9dae-93e634e7a4b3","resolution":{"observed_at":"2026-08-11T14:05:26.536732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.515589Z","title":"TTS-by-TTS 2: Data-selective augmentation for neural speech synthesis using ranking support vector machine with variational autoencoder,","venue":null,"work_id":"42ec3a73-84da-44b9-ae0d-946ca6a9d7dd","year":2020},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.781952Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:f5092caeac710e4d57e9167315777c56bc3fc91c6b94a742ab04732330490b94","observation_id":"4f623136-4b83-4772-98ec-083d16a362ef","resolution":{"observed_at":"2026-08-11T14:05:26.520665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.500162Z","title":"Speaker augmentation for low resource speech recognition,","venue":null,"work_id":"3200d398-cfc3-4d37-bd20-41a1d113b307","year":2018},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.786348Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:46af8761fa81d5265ea5b75b1a942cfc077f78ea821b806cbf71df3a8087bb0f","observation_id":"3e0fbc96-5f59-4500-a78d-89731dd42161","resolution":{"observed_at":"2026-08-11T14:05:26.505299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.484734Z","title":"Overcoming data scarcity in speaker identification: Dataset augmentation with synthetic mfccs via character-level rnn,","venue":null,"work_id":"941a9f14-df0f-4ebd-8bdc-8cb9fc96b585","year":2018},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.790558Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:a87f3e7cda7ad7193351f8ce8c5b939f18af5c64b0bab507d745617c8a7c2de8","observation_id":"871c20cc-f190-43e9-b436-ab8a5947669c","resolution":{"observed_at":"2026-08-11T14:05:26.489895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.469343Z","title":"Target speaker extraction with curriculum learning,","venue":null,"work_id":"1d4277d5-999a-48bf-bd83-fa89f9b36265","year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.795645Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:80f069b3596de60486afe85c8b783387af34156a64200cbd50496231d07a368b","observation_id":"eac30b13-f307-4f99-b3c5-6717e31c8146","resolution":{"observed_at":"2026-08-11T14:05:26.474379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:25.800072Z","title":"Curriculum learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.800072Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:54b331e3fcac744cac69de87d999f153ce77e9fd40838d4faef468b85d0eed13","observation_id":"c5f08fdc-bb07-4df0-8766-8e36006b7d81","resolution":{"observed_at":"2026-08-11T14:05:25.800072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00811","last_updated":"2024-10-05T06:42:40Z","snapshot_observed_at":"2026-08-16T13:13:41.112869Z","submitted_at":"2024-10-01T15:57:35Z","title":"Improving curriculum learning for target speaker extraction with synthetic speakers","version":2},"cited_work":{"arxiv_id":"2410.00811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.00811","snapshot_observed_at":"2026-08-11T14:05:26.056556Z","title":"Improving curriculum learning for target speaker extraction with synthetic speakers","venue":"cs.SD","work_id":"218ff117-c75b-44d7-aab0-cc38d643e8cd","year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.803945Z"},"links":{"cited_paper":"/paper/2410.00811","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:acba9c654c4992fdf11ddd3a81cc9e5233aac65c154e789573b153812fa99e80","observation_id":"1617ea84-6a51-4321-97ab-468889d7cd89","resolution":{"observed_at":"2026-08-11T14:05:26.063213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.445240Z","title":"SALT: Distinguish- able speaker anonymization through latent space transformation,","venue":null,"work_id":"58408945-0bf1-4564-95ca-d6e266e272ba","year":2023},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.808186Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:bc33d565adf849b49f606f0fd873a9739f4d984b7f2fc0383f5b8927de66fb09","observation_id":"9316f2b1-420c-4572-aab6-6dd903560241","resolution":{"observed_at":"2026-08-11T14:05:26.450059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.430319Z","title":"SpeakerBeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"031c441d-d2a3-40da-b2f2-dc7641012483","year":2019},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.812182Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:7af42dc4ee8448148b09e7fd9b680a2f8ec310facfbb34cbc2239fe2660cd5b4","observation_id":"804a8539-7d82-43dc-8fa8-3bfdbb3591e6","resolution":{"observed_at":"2026-08-11T14:05:26.435098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.415933Z","title":"V oiceFilter: Targeted voice separation by speaker-conditioned spectrogram masking,","venue":null,"work_id":"8729f164-cb8e-47d2-82a5-0a2ff2fc8a39","year":2019},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.816184Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:2cb7b045be2cc9974c497718e78ac5bc465ef031b6363b2152150a55c4e1c455","observation_id":"f6bf5473-da86-4929-a7b5-b5e6f429f65f","resolution":{"observed_at":"2026-08-11T14:05:26.420690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.400762Z","title":"Deep neural networks for small footprint text-dependent speaker verification,","venue":null,"work_id":"f3bdb0b6-0011-48c2-9d65-0b5286c72f84","year":2014},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.820412Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:de11ae6a19ada7521bf31c1d35686874c2289fc32e46d9ef82f0d22dd525ac9b","observation_id":"d2ea3ce5-c068-443c-980b-9d92cda77b16","resolution":{"observed_at":"2026-08-11T14:05:26.405758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.386069Z","title":"Conformer: Convolution- JOURNAL OF LATEX CLASS FILES, VOL. XX, NO. X, XXX 2022 12 augmented transformer for speech recognition,","venue":null,"work_id":"7eee0f96-e7a0-4fe2-81a6-2f112dde4891","year":2022},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.824385Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:29320d49063976c8af33fba978e53044c962edc54be10faa66e94f2e9a2abd87","observation_id":"a3b5fd32-94fd-4060-9e11-bb5a4d452b45","resolution":{"observed_at":"2026-08-11T14:05:26.390600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.371035Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":"7166cef2-dc35-4d6d-8409-65f6a18fcafe","year":2020},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.828421Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:be94318d81e94de98dfa311e7d1227c782ba7e152006b0095a6c20030e76a3a3","observation_id":"99968acd-29bc-4dae-9a59-acc260fb9d00","resolution":{"observed_at":"2026-08-11T14:05:26.375718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.357459Z","title":"Complex ratio masking for monaural speech separation,","venue":null,"work_id":"4a911b68-bb1b-4dee-aa1a-2a565d6a1a8f","year":2016},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.832434Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:b2baa9064fad7e3a5ba057c66c34d389b69cb6046307633413f3be249c17bb61","observation_id":"19c705e8-7ddb-458f-91f3-89305faf7973","resolution":{"observed_at":"2026-08-11T14:05:26.361821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.343787Z","title":"CSR-I (WSJ0) Complete,","venue":null,"work_id":"16152815-713f-4237-80d1-674fddc0e058","year":1993},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.836392Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:0a343f5dd7fea88fa0faf3127ad3cb01cff40fc263660ad1b16394c13a3de76c","observation_id":"288dd581-62b1-4ac1-8f38-77c3b136e5bd","resolution":{"observed_at":"2026-08-11T14:05:26.348431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-11T14:05:25.840587Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.840587Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:0efc0439185b7747cb2107f37fb358567cf6f5813208157a10af9c8e7a3f8c7e","observation_id":"da9cba9c-7934-4220-bc05-bfe2a49c4a1f","resolution":{"observed_at":"2026-08-11T14:05:25.840587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.329203Z","title":"Data augmentation for speech separation,","venue":null,"work_id":"04cbcadf-6546-4c2f-95ec-dfad84f340cb","year":2023},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.844693Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:e12ed9a26db10277bbe4bfc7e2591851e89a47f4f1b607c1e65e1aefd6b8d97a","observation_id":"2635c539-2ee4-45c7-aa1f-f127e5be13ad","resolution":{"observed_at":"2026-08-11T14:05:26.333658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.314271Z","title":"Employing real training data for deep noise suppression,","venue":null,"work_id":"005d1ad0-5a2f-4ca9-8a4c-daaa9e2ac9c8","year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.848730Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:a669273738a05a0caa3dc0b3a03b91878a30858fe338b0f9497ef2980d87f9bf","observation_id":"d2e71f56-a5fe-4421-9d43-0ffb6f9d0b29","resolution":{"observed_at":"2026-08-11T14:05:26.318647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.300060Z","title":"Perceptual evaluation of speech quality (pesq)—a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"ab0b426e-32d2-4616-ae0c-df5b7ff27fa7","year":2001},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.852847Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:9118015539fc3e659e84a7f8f8ddc84b953a4d1e1b650160a0d3cd62da8bd4c7","observation_id":"527d4c46-f7f3-4386-ac5c-57653f5451c3","resolution":{"observed_at":"2026-08-11T14:05:26.304912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.284401Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"ab3b2585-33a8-40a7-b381-5175b044bdd0","year":null},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.856726Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:60fd4823f6bedf3b8ab49e90e5fcf2f7c27f49833634202066046df660daf1b6","observation_id":"854c88b4-ee8a-4a76-a158-6de42a5078fc","resolution":{"observed_at":"2026-08-11T14:05:26.289956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-11T14:05:25.865952Z","title":"V ALL-E: Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.865952Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:221e815b8a8e000dc821fae5b8790b5bdf2f6e54d8d7d2437e45616b334054e2","observation_id":"5e94b42c-f0ea-454e-979c-0521f4e787d6","resolution":{"observed_at":"2026-08-11T14:05:25.865952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-20T03:31:53.345681Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-11T14:05:25.870697Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.870697Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:e6c63460b29884e25a1de303fd04d61866d2a5ae5fb845bbfcaaa4bb30d00adc","observation_id":"2ebe90da-d97e-4d12-a128-be2ba4309274","resolution":{"observed_at":"2026-08-11T14:05:25.870697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.254329Z","title":"Synvox2: Towards a privacy-friendly V oxCeleb2 dataset,","venue":null,"work_id":"533573d3-2ce7-48db-b262-31a2c38ea742","year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.875729Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:d5867fa0774b24d733c500da8f21fac679ab7c76e54c643db89f9490fa89891d","observation_id":"cf41df21-2d85-4d03-ad71-8eb0d50cda16","resolution":{"observed_at":"2026-08-11T14:05:26.259664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:25.880173Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.880173Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:eab6213354f25bd3ab0676aefc2329df43b2faa5a36c0d28d0977151db1c0aa9","observation_id":"52217345-bdb1-499b-955b-a8c234d5b174","resolution":{"observed_at":"2026-08-11T14:05:25.880173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:25.884477Z","title":"Nearest neighbor pattern classification,","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.884477Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:3bf44a504f0247839c451d490cdf43b5d8f0abc43523394ab219ff0d9982f1e0","observation_id":"096296db-06f7-4ded-94e9-73174d971e7e","resolution":{"observed_at":"2026-08-11T14:05:25.884477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.221225Z","title":"HiFi-GAN: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"f0becba9-d5dd-4f26-a9c8-1e2e2f0851d9","year":2020},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.889434Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:a6de87cc70de4e6ff82530b315205d04e354fe101a3412c7498bdadc1290d031","observation_id":"cdbb77f7-6cb8-436f-bb4e-a134358a7efd","resolution":{"observed_at":"2026-08-11T14:05:26.226267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.206177Z","title":"Speaker anonymization using orthogonal householder neural network,","venue":null,"work_id":"ef8c8980-3db9-4e29-aeaa-e0e312b90623","year":2023},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.894042Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:d76745fbfd070b51271671b2f1f850d7b2ca038d95a6426c0fe2aac905c7959c","observation_id":"e892e776-5dd9-47b3-8235-e48426ad68c9","resolution":{"observed_at":"2026-08-11T14:05:26.211189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.191192Z","title":"Yet another algorithm for pitch tracking (Y AAPT),","venue":null,"work_id":"09403617-2d24-4f3e-b096-53c951a402ec","year":2002},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.898539Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:65882af65adb3c61e05d7ba45637394c3507c9ec6be06edc1cc4b872f4a6ed58","observation_id":"4c8eb7fe-090e-4898-b47f-7fde47838429","resolution":{"observed_at":"2026-08-11T14:05:26.196025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.176360Z","title":"HuBERT: self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"39335baf-9f24-43f1-b3f8-eb874fcb51a9","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.902947Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:47e99cf75682d58d87e588022cc8b351c71e536d414ca8f79d85fd2e86ee88e4","observation_id":"7e4ed4c6-8c3e-483b-b8f3-2b0f1bad3473","resolution":{"observed_at":"2026-08-11T14:05:26.181280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:25.907289Z","title":"Attentive statistics pooling for deep speaker embedding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.907289Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:bac9743613822ebc22676742c1a89864c831bafb1fd5ad894d0526c014373bfe","observation_id":"d164a870-fcd7-4d8e-9aeb-6b2f8413bd49","resolution":{"observed_at":"2026-08-11T14:05:25.907289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:25.911910Z","title":"Additive margin softmax for face verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.911910Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:59908935c9cccae8a290b40a413ea0b16009771030c9cc00b72d38d9eb5b3ad3","observation_id":"0bfad4d8-744c-4803-b2a0-e44cd4113727","resolution":{"observed_at":"2026-08-11T14:05:25.911910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00463","last_updated":"2024-10-16T16:13:32Z","snapshot_observed_at":"2026-08-18T17:50:22.902771Z","submitted_at":"2024-06-29T15:20:11Z","title":"Open-Source Conversational AI with SpeechBrain 1.0","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00463","snapshot_observed_at":"2026-08-11T14:05:25.916256Z","title":"Open-source conversational AI with speechbrain 1.0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.916256Z"},"links":{"cited_paper":"/paper/2407.00463","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:fbc9a5c7ec9d942a7e24f48d268933c5cde4d739d1fe6c24b99e9f1a9c9221e4","observation_id":"8224650f-5820-4953-82e6-ab950dfccf9e","resolution":{"observed_at":"2026-08-11T14:05:25.916256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.144276Z","title":"V oxCeleb: a large- scale speaker identification dataset,","venue":null,"work_id":"3cf39b60-f9ef-40fe-8f37-a91f65a4dadf","year":2017},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.921052Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:e7a265ccff0f6e3b271774f236350875abc8eeaeb647e41b66417649a896cbbf","observation_id":"c75973e2-3d35-4d1b-b005-75f4b6b5d6a0","resolution":{"observed_at":"2026-08-11T14:05:26.148483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.130226Z","title":"CN-Celeb: multi-genre speaker recognition,","venue":null,"work_id":"7f8c90ec-596c-4486-8c87-b716daa30fd2","year":2022},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.926135Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:b73f3a8b5284348e5e92961fbcf34d0f54e63755266d23941a06c4438ab54419","observation_id":"fb754191-333a-4408-9b30-a31a132ed685","resolution":{"observed_at":"2026-08-11T14:05:26.134549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.116280Z","title":"TorchMetrics - measuring reproducibility in pytorch,","venue":null,"work_id":"9037d164-5066-4fa9-afcd-d07ce718a17b","year":2022},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.931173Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:e6aebf4509c15fc3027decb235617103ada1ee19fbfec7bf1064d687a3051b38","observation_id":"44c5f1b1-47d2-47bc-bed1-0978a1be1f0d","resolution":{"observed_at":"2026-08-11T14:05:26.120482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.102765Z","title":"ICASSP 2021 deep noise suppression challenge,","venue":null,"work_id":"c6bd9b7f-9786-44fb-9755-b7eb8993ad48","year":2021},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.936181Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:297374a945e0f96c249c094d18d858686597c3c6e62e407501d59b1575e06440","observation_id":"31b2afeb-3331-40cb-992a-ee4dd3bd7a85","resolution":{"observed_at":"2026-08-11T14:05:26.106950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01720","last_updated":"2025-02-06T06:42:17Z","snapshot_observed_at":"2026-08-16T13:13:16.997131Z","submitted_at":"2024-10-02T16:32:05Z","title":"Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01720","snapshot_observed_at":"2026-08-11T14:05:25.940672Z","title":"Towards a theoretical understanding of synthetic data in LLM post-training: A reverse-bottleneck perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.940672Z"},"links":{"cited_paper":"/paper/2410.01720","citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:f381c6cb452ba0b2e5e195c1940849af7bff7dc7c02de7f2d9fe2d28315e7cf1","observation_id":"57f5eb54-bea9-4e99-a9ad-6897ee97b23f","resolution":{"observed_at":"2026-08-11T14:05:25.940672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:05:26.269491Z","title":"22 605–22 623","venue":null,"work_id":"1c1d28f4-2c84-485e-a857-a0fe74dfb50a","year":2024},"citing_paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data","version":1},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-08-11T14:05:25.861418Z"},"links":{"citing_paper":"/paper/2412.12512"},"observation_digest":"sha256:17d46b8a54945a4aec4b02e9b38e3b071a138db2c48587fcb8ef4037d3bc8faa","observation_id":"b0f1d672-b665-4b7c-bfdb-d58aeb88c18f","resolution":{"observed_at":"2026-08-11T14:05:26.273992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12512","last_updated":"2024-12-17T04:06:53Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T06:01:15.050371Z","submitted_at":"2024-12-17T04:06:53Z","title":"Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2412.12512."}