{"as_of":"2026-08-09T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:005410c3e292fab0af1bb0c32b43eca5dd6570c0b3827dac347e72621bbad886","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:47:02.923820Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16532/citation-record","integrity":"/paper/2607.16532/integrity","json":"/paper/2607.16532/citation-record.json","paper":"/paper/2607.16532"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:58.482666Z","title":"X-Vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:58.482666Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:b38aac0d8cac70f9803ee19f00e965cd15a30dcdeb99f5f1c0dc7509ebf9da20","observation_id":"ea60aa42-d757-4cf0-b868-9b5f1b9fcd45","resolution":{"observed_at":"2026-08-01T20:46:58.482666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:58.632018Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:58.632018Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:a64f0369bcb211a3ad212415f113cd52278a5cb6083bcbe209ed2e063ebb5791","observation_id":"9e5bc648-c3ba-4132-87f9-acf80addbdb5","resolution":{"observed_at":"2026-08-01T20:46:58.632018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:58.741943Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:58.741943Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:f0a273035ffb05e326c8e29a4d5956be50df191d5cc2637d1b0346199b42d3dc","observation_id":"e8445037-cc92-4250-acf2-cc27bdd46f74","resolution":{"observed_at":"2026-08-01T20:46:58.741943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:58.912281Z","title":"CAM++: A fast and efficient network for speaker verification using context-aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:58.912281Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:775044b114a228ad9dcf7f7cf9c8c8a956f983b00e2ebe41b435a45ce80beb33","observation_id":"87ba9570-58bb-4f1d-ab3b-c8ed57620859","resolution":{"observed_at":"2026-08-01T20:46:58.912281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:58.989129Z","title":"ERes2NetV2: Boosting short-duration speaker verification performance with computational efficiency,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:58.989129Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:ad7736d52315cd2316304a184e52def5eeb1192208259ff6e0dcaf45e74efb3d","observation_id":"b664d2e7-1878-429a-a96d-e70c07eac231","resolution":{"observed_at":"2026-08-01T20:46:58.989129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.124531Z","title":"WavLM: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.124531Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:19f9bec7c14d41c6a0001a4fe1f78f04300db1ad064cb18f9c35972b78aac06f","observation_id":"0985706b-5065-4f99-9131-63925fe9b3cb","resolution":{"observed_at":"2026-08-01T20:46:59.124531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.208735Z","title":"Tackling the score shift in cross-lingual speaker verification by exploiting language infor- mation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.208735Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:0d57799c7b8865ae2cd70a9dc5daa9169f955b310148f5c5a757f5734199f5a0","observation_id":"14041845-443c-41e8-ade2-d79bdcbac401","resolution":{"observed_at":"2026-08-01T20:46:59.208735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.320888Z","title":"Qual- ity measure functions for calibration of speaker recognition systems in various duration conditions,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.320888Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:2ec721e009b094bc228340ecd8e22875ba46987dd3e596e9c805e79734858d2b","observation_id":"11fbd600-5ab0-4375-bd8a-59a368b11c4e","resolution":{"observed_at":"2026-08-01T20:46:59.320888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.443819Z","title":"Quality measures based calibration with duration and noise dependency for speaker recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.443819Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:4d3ebae9ab621d4a95afed33f5730497fb7724c2c725e4c6a2d87e653ffa4272","observation_id":"3ddec76f-6c4f-492a-a537-82f57098be21","resolution":{"observed_at":"2026-08-01T20:46:59.443819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.568049Z","title":"TidyV oice: A curated multilingual dataset for speaker verification derived from common voice,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.568049Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:bdf35a2c26c939fe36a7520f3cb60e1309b4d756a36105b20c3dfe46122be55c","observation_id":"6e3b1cc8-aee2-4281-8d90-d0ac604306d2","resolution":{"observed_at":"2026-08-01T20:46:59.568049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.651939Z","title":"TidyV oice 2026 challenge evaluation plan,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.651939Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:82d75fbe7fd02b88465f613ddddce7427f7cbe3a08fcb8476eaa99320c2a897b","observation_id":"4dabbbd6-90cb-4c7a-bc81-76891828c08b","resolution":{"observed_at":"2026-08-01T20:46:59.651939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.726636Z","title":"The DET curve in assessment of detection task performance,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.726636Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:5e31eb375e9dd51c8610935ebd614e4bc28b42440d6ff725595cf441598b68df","observation_id":"6a18204f-cb7f-42a8-ad58-5212a6c2e0a9","resolution":{"observed_at":"2026-08-01T20:46:59.726636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:46:59.848356Z","title":"Application-independent evaluation of speaker detection,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T20:46:59.848356Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:a899e3dbb32f0d7cbdd161864c27c173ecda36fee7c7d475d96f65b8c37e9683","observation_id":"fb7ad8c5-da7a-4d00-bd0d-ada93fefa513","resolution":{"observed_at":"2026-08-01T20:46:59.848356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1304.2865","last_updated":"2013-04-10T07:32:31Z","snapshot_observed_at":"2026-07-06T03:10:47.979977Z","submitted_at":"2013-04-10T07:32:31Z","title":"The BOSARIS Toolkit: Theory, Algorithms and Code for Surviving the New DCF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1304.2865","snapshot_observed_at":"2026-08-01T20:47:00.006321Z","title":"The BOSARIS toolkit: Theory, algorithms and code for surviving the new DCF,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.006321Z"},"links":{"cited_paper":"/paper/1304.2865","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:766a7b75a002db67e01736c12a2013a5d1ea270dcd32ac2e0d2b0a160ddcaa52","observation_id":"79ec9760-f5af-40e8-8d0f-a2c3238ef419","resolution":{"observed_at":"2026-08-01T20:47:00.006321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1304.2331","last_updated":"2013-04-08T19:49:51Z","snapshot_observed_at":"2026-07-06T03:10:38.974738Z","submitted_at":"2013-04-08T19:49:51Z","title":"The PAV algorithm optimizes binary proper scoring rules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1304.2331","snapshot_observed_at":"2026-08-01T20:47:00.176227Z","title":"The PA V algorithm optimizes binary proper scoring rules,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.176227Z"},"links":{"cited_paper":"/paper/1304.2331","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:1c5fc6a055e71bca80de1799edf382b96b4f39e9c5373805f903ab37d4673622","observation_id":"41c96935-be1b-420a-b82d-b159a6b71d07","resolution":{"observed_at":"2026-08-01T20:47:00.176227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:00.364578Z","title":"A comparison of linear and non-linear calibrations for speaker recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.364578Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:c03a8bb49a33ac1f50852a2bd2830c9a4428fdbaa6f36a2f8af6db21803ae6f9","observation_id":"feec5e7e-8467-49c9-82d4-acc8fa77ecf6","resolution":{"observed_at":"2026-08-01T20:47:00.364578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:00.539412Z","title":"Robustness of quality-based score calibration of speaker recognition systems with respect to low-SNR and short-duration conditions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.539412Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:03f2fe4540be5c65c044f137e9ba1bd7d68e677ff46fb72eefb563d8b8eb37bc","observation_id":"cb4eae53-928c-48b1-abe8-fe37821c1852","resolution":{"observed_at":"2026-08-01T20:47:00.539412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:00.682587Z","title":"Trial- based calibration for speaker recognition in unseen conditions,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.682587Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:2e744e20e0f8e0d4c7f7888a85cdd63de0827b2597b4f88455b17a55ec6bc40b","observation_id":"72bc8ec9-b0ce-4b93-a32b-1d2753eb19ad","resolution":{"observed_at":"2026-08-01T20:47:00.682587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:00.814106Z","title":"A speaker verification backend with robust performance across conditions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.814106Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:b6b12d154129500993b1de8e24a60bd0383d8810379139f14dd16ba34ef43a01","observation_id":"5a7d6ed6-26f0-43f0-8f62-8a3331826db1","resolution":{"observed_at":"2026-08-01T20:47:00.814106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:00.921461Z","title":"A generative approach to condition-aware score calibration for speaker verification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:00.921461Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:d4b996dad04a83c00041d9d329946e94ea1fbef8bf4605b910960f272965a270","observation_id":"7d9cb453-fc5a-46f3-abd5-768820fc5a87","resolution":{"observed_at":"2026-08-01T20:47:00.921461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:01.038798Z","title":"The IDLAB V oxSRC-20 submission: Large margin fine-tuning and quality-aware score calibration in DNN based speaker verification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.038798Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:a087ba70c4e87a4290512b177c2d26a0f0af627c37ef0765d29501b9d003be43","observation_id":"b7ecb2f3-e5ec-4e6d-8cf8-82fd611353de","resolution":{"observed_at":"2026-08-01T20:47:01.038798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:01.143000Z","title":"Selective classification for deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.143000Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:d2dd1b1bcdd6038b65fec4a94745717218b3529b232bdf159606c2f434bb3c44","observation_id":"aa9c374f-279e-4f55-a069-13a95f685f31","resolution":{"observed_at":"2026-08-01T20:47:01.143000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:01.261565Z","title":"Toward fail-safe speaker recognition: Trial-based calibration with a reject option,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.261565Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:f6d40372fb9bdb5dba18431f840423d8fab1a213df5da362570171dfee4d1e5f","observation_id":"da395f09-07f5-40a9-ad63-f226b023434c","resolution":{"observed_at":"2026-08-01T20:47:01.261565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:01.379430Z","title":"V oxceleb: A large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.379430Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:f999cddc231cf7c6eadda579a4eaaf7da269595df2a648b0c854b54a1c990d59","observation_id":"6d05b740-8d8a-4958-84ee-380eafc08f5e","resolution":{"observed_at":"2026-08-01T20:47:01.379430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:01.498908Z","title":"Dis- entangled representation learning for multilingual speaker recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.498908Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:fa5063baa68a00a0f4aa2c879e9b6c41e29c74c6088d4d7d5cd925d15d20100f","observation_id":"3d54e41a-dc19-4ccf-bce1-5b32af62dead","resolution":{"observed_at":"2026-08-01T20:47:01.498908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:01.850586Z","title":"3D-Speaker-Toolkit: An open- source toolkit for multimodal speaker verification and diarization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.850586Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:a05c8d952d8265185f5409f3298dfcaa9ad3a769a7a35d60009a674dd44bce7e","observation_id":"0f5a10d9-aaf8-411a-b41b-946539269c9f","resolution":{"observed_at":"2026-08-01T20:47:01.850586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-01T20:47:01.949077Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.949077Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:57700aa2ccc711fbca68f7115019313ae984a6c2ddc3e4ef6a90ea40bafb3206","observation_id":"c8fb1b8b-eb95-450e-94d0-e43b9f32b617","resolution":{"observed_at":"2026-08-01T20:47:01.949077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.020089Z","title":"Dropout: A simple way to prevent neural networks from over- fitting,","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.020089Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:58972da7a6186a5a9c16070f706a7324ab50a534fc6b930dd96475c6c4b1086b","observation_id":"9f28ff09-fd04-4347-98ad-091ab87e05e0","resolution":{"observed_at":"2026-08-01T20:47:02.020089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-01T20:47:02.106077Z","title":"Searching for activation functions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.106077Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:5159267fec1060f1af987d5a5b8aebc561d256700326e1ecf8f041da9f1c6a7c","observation_id":"15263530-922f-4eed-92ff-6ea328ae8dec","resolution":{"observed_at":"2026-08-01T20:47:02.106077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.166205Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.166205Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:8599c3725ac53a4018e6e07c8f99fdb20e42c439a40a53210642a2b8e77c1fb1","observation_id":"9f8d87ef-3b95-4c9d-904c-2929407573f0","resolution":{"observed_at":"2026-08-01T20:47:02.166205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.253160Z","title":"Simple attention mod- ule based speaker verification with iterative noisy label detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.253160Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:ddd671598ee526cf60bcb07677d2dcd95de1ad7853ddfbbe8a99cd93502cde73","observation_id":"07e420a1-dc0f-4b27-a635-27247d4f700e","resolution":{"observed_at":"2026-08-01T20:47:02.253160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.326793Z","title":"Language-invariant multilingual speaker verification for the TidyV oice 2026 challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.326793Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:4010b8b07f34a8af43b8a526785d4e3f4042a23b2b698252f7271e930c755429","observation_id":"ea1c0e2b-f351-40c9-b668-411fc9eca43a","resolution":{"observed_at":"2026-08-01T20:47:02.326793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-01T20:47:02.397442Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.397442Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:e3869fc11cff2ec46ec5684cd65451b43cb5c32c48453cf76179859fa366bef7","observation_id":"8c533b46-5142-4199-a6da-7df8b69f18f0","resolution":{"observed_at":"2026-08-01T20:47:02.397442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.484694Z","title":"w2v-BERT: Combining contrastive learning and masked lan- guage modeling for self-supervised speech pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.484694Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:679d73ccc322882b365bcf940bc4509c89a5d6d4b89aa1b11da0e66e5e92a6e4","observation_id":"d7c90069-0202-4df7-a01a-b15ba20ccc20","resolution":{"observed_at":"2026-08-01T20:47:02.484694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.561869Z","title":"Efron and R","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.561869Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:7bbb728d66da8dd44ee93a9ee1c212b5722f59fd991283cb6ffe3de8ba8bb427","observation_id":"a9b88606-b24a-4d80-a909-d0947ac7b125","resolution":{"observed_at":"2026-08-01T20:47:02.561869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.600165Z","title":"Confidence intervals for evaluation in machine learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.600165Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:3d383309ca3a3f648b7f6861cf8f6d8ea8841d0bde66ca6f477eaff1abadad2b","observation_id":"803c5229-c47c-4772-98f4-62863aba91b6","resolution":{"observed_at":"2026-08-01T20:47:02.600165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.660075Z","title":"Analysis of score normalization in multilingual speaker recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.660075Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:3e99181ba1870b9d6ef6f7ddb2efc648ca76b3f7ef7e4f008d3dfcf6d6cccc60","observation_id":"9b4f55dd-85a9-47e9-b430-e35d18e12e30","resolution":{"observed_at":"2026-08-01T20:47:02.660075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.737450Z","title":"Within-class covariance normalization for SVM-based speaker recognition,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.737450Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:7bd8b6b227bbf0194d01a0407bef397a3375295e24eec83b88ef9760713e504b","observation_id":"ab440bbc-e1be-419a-8748-b1cccb423c2e","resolution":{"observed_at":"2026-08-01T20:47:02.737450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.825785Z","title":"Front- end factor analysis for speaker verification,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.825785Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:e0192cba9ff3901f71dab23b4d684fce9845bfb853a4c2a474e587f127531040","observation_id":"c7832bbd-ff68-4d78-a009-572b1fbc03b9","resolution":{"observed_at":"2026-08-01T20:47:02.825785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:47:02.923820Z","title":"On the generalized distance in statistics,","venue":null,"work_id":null,"year":1936},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:02.923820Z"},"links":{"citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:0ab052f98121424b4e230c3ea62e8e39ed48d24ea345ddf0a47ceaacb879f70a","observation_id":"f02075df-9714-4d62-ac4a-415f594bf058","resolution":{"observed_at":"2026-08-01T20:47:02.923820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-01T20:47:01.794889Z","title":"Available: https://arxiv.org/abs/2106.04624","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T20:47:01.794889Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2607.16532"},"observation_digest":"sha256:4b6e356920aae0666a75a1d99924c25ae63d5fbeaa4de50ead08cd5bb698b06b","observation_id":"24215b28-f5b4-4b50-b952-df5106a09a86","resolution":{"observed_at":"2026-08-01T20:47:01.794889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16532","last_updated":"2026-07-17T22:13:02Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T13:25:22.861832Z","submitted_at":"2026-07-17T22:13:02Z","title":"AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2607.16532."}