{"as_of":"2026-08-16T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23181e779aebb32c70e1a6179e92d5d1e9961ecb4267b12aee49a9b4aa23d032","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:21:58.204834Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T15:07:52.715880Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T15:16:18.188094Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"cited_work":{"arxiv_id":"2506.14427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14427","snapshot_observed_at":"2026-07-09T15:16:18.188094Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","venue":"eess.AS","work_id":"db36c197-ca04-42f0-bb53-7e219303e575","year":2025},"citing_paper":{"arxiv_id":"2607.07294","last_updated":"2026-07-08T11:34:00Z","snapshot_observed_at":"2026-08-08T06:24:18.456938Z","submitted_at":"2026-07-08T11:34:00Z","title":"Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T15:07:52.715880Z"},"links":{"cited_paper":"/paper/2506.14427","citing_paper":"/paper/2607.07294"},"observation_digest":"sha256:628e0aa5cd020320585ce23e003104fb35eb9088341e64cf32ffa1364e7440fd","observation_id":"627f9364-7480-480c-a8e3-e381cc071047","resolution":{"observed_at":"2026-07-09T15:16:18.189364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14427/citation-record","integrity":"/paper/2506.14427/integrity","json":"/paper/2506.14427/citation-record.json","paper":"/paper/2506.14427"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:13.584743Z","title":"A review of speaker diarization: Recent advances with deep learning,","venue":null,"work_id":"5d91e1f0-0108-4ba6-b20f-6326148dfe39","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.470683Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:a1136d70cd960908ebe78c733c34c4eb4ce8a5df106dda62c45938897fc7177e","observation_id":"d3f82b19-44d6-435f-9c02-be0f261f38bb","resolution":{"observed_at":"2026-08-07T00:22:13.659626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:13.373229Z","title":"Speaker diarization: A review of recent research,","venue":null,"work_id":"a01d96bf-80e4-4eed-8388-eac8367d6f5f","year":2012},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.640545Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:fd5995957ad530f79f8c0126ac20ab808964edc7a8a29d08b1415bdca7756eac","observation_id":"e13f9fe6-6fd1-4b5a-961a-4aeb8dd64713","resolution":{"observed_at":"2026-08-07T00:22:13.458552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:13.156012Z","title":"Speaker diarization with lstm,","venue":null,"work_id":"2f290009-5ada-4fd0-a4b4-10e7b437f159","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.787115Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:41a20cc62fac03259af0f8f7c08e419e07e21eba65c8bc05979cf0f141ca25da","observation_id":"ec32f24c-0d18-4624-b2e7-4f1c8a84a765","resolution":{"observed_at":"2026-08-07T00:22:13.238820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:21:50.865767Z","title":"Front- end factor analysis for speaker verification,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:50.865767Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:6d56d23ba2dfb7b371fc7274a6581e312fcce2b2146c1ed73d35b3e96cbd6dd4","observation_id":"73ef4eec-b169-4a19-99fd-25a05bff166e","resolution":{"observed_at":"2026-08-07T00:21:50.865767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:12.843132Z","title":"X- vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"67e39f1f-3a14-40e5-b4a9-18fc05857737","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.002901Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:49b26ebea7300a59f150c0665790306e09a3782453aef55b6928abcfb40b3ea2","observation_id":"9c5e0ead-22dd-4f87-8f96-979565dfbea6","resolution":{"observed_at":"2026-08-07T00:22:12.974964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:12.495048Z","title":"Developing on-line speaker diarization system","venue":null,"work_id":"4efe856f-08ab-470d-a265-5ef246775228","year":2017},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.144910Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:0fe085d224fd43b94a07935f075a434a1be8d743868c53333a7cf49ce2e8f452","observation_id":"56007a15-7a95-4dad-9254-627bcce8099a","resolution":{"observed_at":"2026-08-07T00:22:12.703109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:12.080840Z","title":"A study of the cosine distance-based mean shift for telephone speech diarization,","venue":null,"work_id":"7540a336-ad50-47de-addf-431903cb81a8","year":2013},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.314753Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:b683f39a18ad7fa65b742fa86e2a7681c199ccd6501dc57624c12b07dffe8ec5","observation_id":"1efab697-e996-43c9-b157-0884261e392a","resolution":{"observed_at":"2026-08-07T00:22:12.304830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:11.601836Z","title":"Speaker diarization with lstm,","venue":null,"work_id":"b4dd57e7-2ce5-4a4d-a526-04ae050482c4","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.517631Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:da12c202cc845692cfa056f5ca229b02e04d10985de9502a88fc5c54f624506f","observation_id":"09e744c1-aa83-4cfa-bc3a-41559e4f6828","resolution":{"observed_at":"2026-08-07T00:22:11.883861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:11.248168Z","title":"A robust stopping criterion for agglomerative hierarchical clustering in a speaker diarization system","venue":null,"work_id":"61fb5ede-1c68-4fcf-869b-5fa3a00ea75d","year":2007},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.731444Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:2f8a134878836a9c2b16195c056278388249ea815fbf38fe7f7642fb26e5b880","observation_id":"fde14acd-eef8-4b76-a3dd-e02491bab023","resolution":{"observed_at":"2026-08-07T00:22:11.374824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:10.645811Z","title":"Characterizing performance of speaker diarization systems on far-field speech using standard methods,","venue":null,"work_id":"f9af5436-19bd-40e7-bfbc-cec678a5b280","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:51.890542Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:d07f80c54249f8abfc6ee0d7f5fb1719ffabc5c628fae2d30a4c3865e8a3c912","observation_id":"ad39687d-62ea-4546-9eb8-9db7c3a523f3","resolution":{"observed_at":"2026-08-07T00:22:10.884984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:10.332439Z","title":"Discriminative neural clustering for speaker diarisation,","venue":null,"work_id":"da6fa763-76e1-4c4a-9560-ef7346e490b6","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.094815Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:d7e9c6a614929124f6a5aaccc3661eced44dc84f85c395cadf528ac5ffb453a2","observation_id":"f87ca2c2-33fb-4503-8ebe-fe82f85839e9","resolution":{"observed_at":"2026-08-07T00:22:10.494758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:09.984749Z","title":"Bayesian hmm clustering of x-vector sequences (vbx) in speaker diarization: theory, implemen- tation and analysis on standard tasks,","venue":null,"work_id":"080ccc3b-9321-4ffb-bb57-343f14b0c019","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.305116Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:67f768324f8a0a6512e29dbd5b546d3d684f5d34a84de39479bcbfcce811db9d","observation_id":"1799a67a-a6c6-4938-a63d-5af4012ce448","resolution":{"observed_at":"2026-08-07T00:22:10.129979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:09.795887Z","title":"End-to-End Neural Speaker Diarization with Permutation-Free Objec- tives,","venue":null,"work_id":"ba9f8cbd-ccf6-4d69-8ff4-43a5a9340ae8","year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.444837Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:2ba8068ee58d027d2afac77761468bb9a876d2b981c67c85d8f6cb46ce57dfe0","observation_id":"6c09ff5f-6367-4f97-b3af-add1a7bd70f9","resolution":{"observed_at":"2026-08-07T00:22:09.865817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:21:52.593916Z","title":"End-to-end neural speaker diarization with self-attention,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.593916Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:c5e8a03ae92d294ec31c7f34cc7b53b54f8c6f09e2a0608f9b5d235511282682","observation_id":"6962df6d-2f1d-46a9-b7ff-7e1488b08cd9","resolution":{"observed_at":"2026-08-07T00:21:52.593916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:09.458601Z","title":"Auxiliary loss of transformer with residual connection for end-to-end speaker diarization,","venue":null,"work_id":"336011a1-b4f0-4885-a92c-c32c4ae7cef1","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.694892Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:8c5065e1503428e635ebc007405c9f4c91d2e314fa7517014c966ca51792d925","observation_id":"7a66dfec-ffab-4768-bbe7-c47f87b803ec","resolution":{"observed_at":"2026-08-07T00:22:09.614817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:08.864846Z","title":"Incorporating end-to-end framework into target- speaker voice activity detection,","venue":null,"work_id":"daf0299c-2612-425e-91a3-311441dc2d70","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.834754Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:a0bcccf994cbbdb939ce0fa3a50475a907494077cbd29d4b23afeeb96a466d6f","observation_id":"91d2595b-6fe6-4cd8-ac5e-ddf332add929","resolution":{"observed_at":"2026-08-07T00:22:09.328883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:08.385831Z","title":"Target-Speaker V oice Activity Detection: A Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario,","venue":null,"work_id":"944e1826-400e-4601-9e48-7656c1d3ace5","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:52.935871Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:d7ae60dda81c9c3946022886df5232e112b55a26203c4c2fc7e497dc3dc7d328","observation_id":"48b1ea25-89ef-42ed-8019-a486ea98782c","resolution":{"observed_at":"2026-08-07T00:22:08.528593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.994765Z","title":"Ansd-ma-mse: Adaptive neural speaker diarization using memory-aware multi-speaker embed- ding,","venue":null,"work_id":"bcdfbb65-9cd7-4b2a-bbd3-3f2ac52edfa5","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.134746Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:cfad2a9e2775b8c22ae1699d25794a8e892a18695e39fab9e12ef48f860500ae","observation_id":"e72957de-844b-4af2-b005-b6d83bdb7240","resolution":{"observed_at":"2026-08-07T00:22:08.157893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13734","last_updated":"2023-07-14T09:45:21Z","snapshot_observed_at":"2026-08-13T11:10:25.206671Z","submitted_at":"2023-06-23T18:49:20Z","title":"The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13734","snapshot_observed_at":"2026-08-07T00:21:53.248557Z","title":"The chime- 7 dasr challenge: Distant meeting transcription with multiple devices in diverse scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.248557Z"},"links":{"cited_paper":"/paper/2306.13734","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:a9c148907a4183a55c9984cecdd89853c53db318f0206754e9734a8d9e5aa5dc","observation_id":"2716b444-1e63-4fc5-9248-731d85914f91","resolution":{"observed_at":"2026-08-07T00:21:53.248557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.600591Z","title":"The ustc-nercslip systems for chime-7 challenge,","venue":null,"work_id":"6c4c1083-723f-4818-b4c3-acd19e9d7184","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.427755Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:dd8e268313a8cd6e52f0428254f324ce3b6cb1b9fdc06650375bee0ce3e46323","observation_id":"8ff547e6-29f0-42fd-a60f-6f86231dddc2","resolution":{"observed_at":"2026-08-07T00:22:07.773098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.453060Z","title":"Audio-visual speaker diarization based on spatiotemporal bayesian fusion,","venue":null,"work_id":"28a71f4c-5389-4db0-875d-53b7820455aa","year":2017},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.571500Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:040f8de1b408f1717801d985b129862ff265536b08d4656039c6e1f33546224f","observation_id":"bca27e2b-c9db-4d31-a9a3-d0314d2ed985","resolution":{"observed_at":"2026-08-07T00:22:07.537163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:07.184885Z","title":"Quantitative association of vocal-tract and facial behavior,","venue":null,"work_id":"c779484a-de98-47c6-b088-4f5d5a1fcdc4","year":1998},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.778190Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:8d6a200071d80c0860d576b5a36fc814ebc3d3fb05be80763ccd414f70963516","observation_id":"c773421d-5f15-4cde-850b-8864ec10fbf1","resolution":{"observed_at":"2026-08-07T00:22:07.309079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:06.969497Z","title":"Multimodal speaker diarization,","venue":null,"work_id":"8a17d53d-a027-45f0-a6f6-8592b4e7a079","year":2011},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:53.934772Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:ae536305a947cca4affc53003a4a4cddea287517a88d39d479ece5d0c4c84600","observation_id":"e43a8855-a018-4c74-aa81-c275a07f6cf7","resolution":{"observed_at":"2026-08-07T00:22:07.064881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:06.617520Z","title":"Who said that?: Audio-visual speaker diarisation of real-world meetings,","venue":null,"work_id":"b9f43188-c13f-4c61-9c8b-92cea4786871","year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.094834Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:fc6f250b5def6c2683640da6b9e75cfc9b120b3e01fa8f73ea574198a025a909","observation_id":"ce9ae35e-a165-40e7-985d-40c08a73cb89","resolution":{"observed_at":"2026-08-07T00:22:06.764776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:06.294758Z","title":"Spot the conversation: Speaker diarisation in the wild,","venue":null,"work_id":"3e555924-6af6-4beb-ae76-6329cd0b2861","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.254227Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:f68f036387939ae3fdb2c5758585bab50947fdcd47e0b6d904f659e10d1e3a22","observation_id":"2e95f8fa-c44d-44f1-87d8-08440b71e7b2","resolution":{"observed_at":"2026-08-07T00:22:06.436582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.798774Z","title":"End-to-end audio-visual neural speaker diarization,","venue":null,"work_id":"1d69cf39-873b-4c5b-b563-6f36ae03d8c0","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.571101Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:302198a4420ee301e55be7624abc830c13e268b8f726ecdb1e131d8c77dee58f","observation_id":"428b31c9-85f8-4f23-9c29-9dac8e0da984","resolution":{"observed_at":"2026-08-07T00:22:05.908267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08052","last_updated":"2025-07-31T10:50:49Z","snapshot_observed_at":"2026-08-13T17:38:27.423649Z","submitted_at":"2024-01-16T02:06:28Z","title":"Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization","version":3},"cited_work":{"arxiv_id":"2401.08052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08052","snapshot_observed_at":"2026-08-07T00:21:59.600878Z","title":"Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization","venue":"eess.AS","work_id":"ecab30e6-7498-4cb6-a64a-6b8655278b5f","year":2024},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:54.869454Z"},"links":{"cited_paper":"/paper/2401.08052","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:75b2363dc576e74147c8cc3fa3c0ca29a7f8dc1658215a50bec9f0df66955029","observation_id":"c140ea81-7ae9-40be-b600-f63c29793861","resolution":{"observed_at":"2026-08-07T00:21:59.726773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22350","last_updated":"2024-10-15T05:48:30Z","snapshot_observed_at":"2026-08-12T22:23:03.234865Z","submitted_at":"2024-10-15T05:48:30Z","title":"Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2410.22350","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22350","snapshot_observed_at":"2026-08-07T00:21:59.227055Z","title":"Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization","venue":"cs.MM","work_id":"52fd8f8e-bdae-445e-b82a-c019f98cd649","year":2024},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.024954Z"},"links":{"cited_paper":"/paper/2410.22350","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:abeaec5fce9a3352c542a19e9a8e919ea45ecb66bd51b7503838f1f2eefacd10","observation_id":"0fa53158-fd14-451c-907c-60b3a82249c7","resolution":{"observed_at":"2026-08-07T00:21:59.396178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.461422Z","title":"Semi-supervised multi-channel speaker diarization with cross- channel attention,","venue":null,"work_id":"c7b70c82-a93c-4072-9caf-2305fabe3cc3","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.124886Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:b71100336a3888add308e10d78a7894436d7991f89038d8254e0c9a48c73468b","observation_id":"2ffe891a-1a73-45a7-907e-004876e43b21","resolution":{"observed_at":"2026-08-07T00:22:05.602331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.305383Z","title":"Aishell-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":"2596af0d-c886-4093-b652-1242ae75e07e","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.207393Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:04049d0405fe5ea457f52437911542f552b478f7f6f278b9a0468ac247d47533","observation_id":"e1c36b09-1a9e-4a1b-8abf-6cfe9b2aafed","resolution":{"observed_at":"2026-08-07T00:22:05.349237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:05.015949Z","title":"Ava-avd: Audio-visual speaker diarization in the wild,","venue":null,"work_id":"a0adfa91-92b7-4a9b-b821-719b25d29a62","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.324692Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:f5b6ff6fffa8b5b3cf873f549a0832d77f89100824248a96469f036d8fe182a6","observation_id":"026db9a8-134e-4b29-b845-835258614c2c","resolution":{"observed_at":"2026-08-07T00:22:05.115533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:04.618941Z","title":"Semi-supervised training with pseudo-labeling for end- to-end neural diarization,","venue":null,"work_id":"f6fcad2f-0e8d-49fe-8988-d264ffb55874","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.483931Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:5400d8d4fdaae5fc517bcd27dbbea771e4a315373097a3a12f30184612b1867a","observation_id":"05fbe6af-a073-45db-bb76-3551a48e1ab3","resolution":{"observed_at":"2026-08-07T00:22:04.756713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:04.152555Z","title":"Chime-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings,","venue":null,"work_id":"b7dd7ef8-c878-4ac3-a046-0dcc1b1f9f56","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.624749Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:9d662927b89fa642c0786f4a677927608c1dae174593d62dea95a8f05e2a6867","observation_id":"f4fd928c-abbd-4ec0-8ea1-5b27ae7b4a26","resolution":{"observed_at":"2026-08-07T00:22:04.309737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.814741Z","title":"The multimodal information based speech processing (misp) 2022 challenge: Audio- visual diarization and recognition,","venue":null,"work_id":"a0df532f-4e35-4f05-8605-375296c8f8ca","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.784828Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:7aa11c95caea4fa07bc7fe2ce4595ffb3c8fe4766db4846456568baacfb6a38b","observation_id":"ac8da1ae-9ff5-4ccc-b653-e77e25873ae7","resolution":{"observed_at":"2026-08-07T00:22:03.958320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.555759Z","title":"Notsofar-1 challenge: New datasets, baseline, and tasks for distant meeting transcription,","venue":null,"work_id":"aeca271b-836c-4420-b1c2-1fd1a21321ad","year":2024},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:55.902011Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:6419180ca428fa366a13d532fc080223acda3e135936a91710d4b4e268cad497","observation_id":"284f3f73-a188-42a9-86b4-331cfea318fa","resolution":{"observed_at":"2026-08-07T00:22:03.664897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.314743Z","title":"The nist speaker recognition evaluations: 1996-2001","venue":null,"work_id":"06cc0967-3aeb-43aa-ae8e-3cfa899cc913","year":1996},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.047128Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:5bb7342f58b75aee6da6d39a609ae85f84ba110a9227aa7cbac1810adfb9b43f","observation_id":"cedac64d-e72b-4cea-976f-faf267d75d7e","resolution":{"observed_at":"2026-08-07T00:22:03.410058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:03.133506Z","title":"First dihard challenge evaluation plan,","venue":null,"work_id":"b7fab959-602a-49ab-b5bd-f71fccd3e8f7","year":2018},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.162241Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:665a36c21c823ca24150158edb35aec09a59c3a17b22aa7c0dd7aee12e2629f7","observation_id":"6dad5101-8ed9-4e39-b33c-813a367f287b","resolution":{"observed_at":"2026-08-07T00:22:03.186514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07839","last_updated":"2019-06-18T23:04:09Z","snapshot_observed_at":"2026-08-14T16:13:37.304747Z","submitted_at":"2019-06-18T23:04:09Z","title":"The Second DIHARD Diarization Challenge: Dataset, task, and baselines","version":1},"cited_work":{"arxiv_id":"1906.07839","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.07839","snapshot_observed_at":"2026-08-07T00:21:58.794074Z","title":"The Second DIHARD Diarization Challenge: Dataset, task, and baselines","venue":"eess.AS","work_id":"372f86ac-b03b-4101-9890-1c654ca339e8","year":2019},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.288230Z"},"links":{"cited_paper":"/paper/1906.07839","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:7732028e031373d9bb95deb19c93d442b9361cd4f9dc0d3c264612dd35a97f70","observation_id":"68cf3cf7-1053-4eba-8bcb-860721340f5e","resolution":{"observed_at":"2026-08-07T00:21:58.984753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.01477","last_updated":"2021-04-05T17:23:19Z","snapshot_observed_at":"2026-08-14T16:06:32.761909Z","submitted_at":"2020-12-02T19:33:44Z","title":"The Third DIHARD Diarization Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.01477","snapshot_observed_at":"2026-08-07T00:21:56.433967Z","title":"The third dihard diarization challenge,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.433967Z"},"links":{"cited_paper":"/paper/2012.01477","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:ed41766a9f395d2fede135bc968fb4f47f6a0311b0725167d6ff8a4b18148101","observation_id":"7b1e1bb5-efde-4eee-9410-07ad6e9434eb","resolution":{"observed_at":"2026-08-07T00:21:56.433967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:02.754798Z","title":"M2met: The icassp 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":"6d0a0e91-edb2-4c17-acf7-3ee2ca40655c","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.562953Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:a0b91f9ae82249742a9ae0bc596f91407a8c77237f02ab09cec344bbf45c68b0","observation_id":"5daffbd3-c75b-4dee-adf6-aea506583848","resolution":{"observed_at":"2026-08-07T00:22:02.864740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:02.468667Z","title":"The ami meeting corpus,","venue":null,"work_id":"daa77022-d0c2-4b18-a5e2-b0054fcf99d3","year":2005},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.667720Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:fe9d309b4ea572bfdaa53ac1f5e2f9f1d7873846861f74e09a1598b49723a8ac","observation_id":"f88caf64-7715-4f24-94b6-681e862c35be","resolution":{"observed_at":"2026-08-07T00:22:02.615362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-15T19:07:02.989483Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T00:21:56.777201Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.777201Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:1a72c141ca821f68a843e65456967d0268f021891298927ed4ed854e6b7bf861","observation_id":"dca6c443-3407-4b0b-92fb-977eb884cbde","resolution":{"observed_at":"2026-08-07T00:21:56.777201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:02.175762Z","title":"Msdwild: Multi-modal speaker diarization dataset in the wild","venue":null,"work_id":"6a1ba3c1-0d15-4ae4-8d28-8f3a6cd41205","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.893682Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:134eb1bbb1a0912516fe0d7c3c8f1fc683f28c4969a953a0a1b3d824a8675987","observation_id":"5438a602-d4a0-4270-b8f1-af5dabe50ec5","resolution":{"observed_at":"2026-08-07T00:22:02.314881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.944839Z","title":"An approach to scene change detection,","venue":null,"work_id":"9a689d94-de87-433b-9481-d72707e782ce","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.984747Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:b46b58288778b92bdb443dfd202080f727a7e5a09d7eb09ff918ae8c524f0100","observation_id":"17e3e495-23e7-4b84-b33e-6598d3733f73","resolution":{"observed_at":"2026-08-07T00:22:02.056694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.650711Z","title":"Dnsmos p. 835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"1c16c6d2-c06a-46ff-acb9-ceb6c33786c2","year":2022},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.111910Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:b9bf1cafedb5611125cf7d0f91c866e873af9551668b1c58d8918b0cc1140f11","observation_id":"d947b473-73bc-4c55-b50d-545945fa1c29","resolution":{"observed_at":"2026-08-07T00:22:01.804829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.401925Z","title":"Md-vqa: Multi-dimensional quality assessment for ugc live videos,","venue":null,"work_id":"378a7277-1778-4c71-82bb-6fdb799db8f6","year":2023},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.220765Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:7c95011d018be42d3374e3ed1fc8d44ced3a2f82f4de95ffc7ab5fb5022e6182","observation_id":"b6875ee2-91e5-4828-9401-ffd2f0c4e60b","resolution":{"observed_at":"2026-08-07T00:22:01.506885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:01.179739Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"84bf16d5-aba3-4923-a8ff-496443a41a0e","year":2016},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.380226Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:8686cc0238c240ce21abd5f758a7f20761fa59fc8a43194d8db5af5087cfa6cf","observation_id":"c6a24fa6-3ee0-42bd-a628-9d00325f3f8b","resolution":{"observed_at":"2026-08-07T00:22:01.255798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.894544Z","title":"Retinaface: Single-shot multi-level face localisation in the wild,","venue":null,"work_id":"c5a04e21-88f5-4af1-9604-0d2dc0f883f9","year":2020},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.559593Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:7f7095ed4c7ccfca80a00944d93cb3d3a74342a7e71e40b508a54b254a81c47c","observation_id":"8a3154c0-925e-43c5-bf15-519b2d0f01ca","resolution":{"observed_at":"2026-08-07T00:22:00.979743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.624748Z","title":"Simple online and realtime tracking with a deep association metric,","venue":null,"work_id":"badd624a-81f8-4107-bd68-627274596d0b","year":2017},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.702925Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:3003279653cc34e4b6f4ec282e1f35d182c42657ed5370ea705050001cdeaf7c","observation_id":"6c5c5a94-fc8e-4f58-be3c-5990295ce602","resolution":{"observed_at":"2026-08-07T00:22:00.738802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-15T17:22:09.610128Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T00:21:57.834750Z","title":"Mediapipe: A framework for building perception pipelines,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:57.834750Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:defb80c1d106605eb3521a8730fd6036c6acadb2b308328af4c85c801e5ec421","observation_id":"a6efce1f-5493-45e2-acdb-574c78d25f91","resolution":{"observed_at":"2026-08-07T00:21:57.834750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.364751Z","title":"3d-speaker-toolkit: An open-source toolkit for multimodal speaker verification and diarization,","venue":null,"work_id":"3ad3d72f-74fb-4842-9c9a-97b0aa744504","year":2025},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:58.044836Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:11b1e34031be1fea465abdc3a3ef5a17678b7febf8bf1858b1646a3edd93c157","observation_id":"7e4dfd2a-1d75-4bae-a506-09f2c1823712","resolution":{"observed_at":"2026-08-07T00:22:00.464756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:22:00.146674Z","title":"Dover-lap: A method for combining overlap- aware diarization outputs,","venue":null,"work_id":"14e3e625-488f-45a4-b598-63d928f4923f","year":2021},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:58.204834Z"},"links":{"citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:c19038a7993b5a3d045e1dee3deb4d1ffa0d7b1a34cefe10d0df9fedfed4126c","observation_id":"10058e43-5b10-47f4-b6a0-c3e06c096d82","resolution":{"observed_at":"2026-08-07T00:22:00.209099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":3,"verified_fuzzy":43},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2506.14427."}