{"as_of":"2026-08-16T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6f2f76ba12e7f85fce64494aa607aeb0053addb2c11b919e1df68ee952c3d29","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:26.148077Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:24.209433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:23:26.439493Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2505.24545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24545","snapshot_observed_at":"2026-08-07T12:23:26.439493Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","venue":"eess.AS","work_id":"25dd815c-0c4d-4978-8d28-a0b968fad9d1","year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.209433Z"},"links":{"cited_paper":"/paper/2505.24545","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:22af2e9edaebe56e7e26d1549debc8060611156869490338cd9d4f6e922e2cdf","observation_id":"7a67bcdb-cc66-49d2-bb45-d46264868983","resolution":{"observed_at":"2026-08-07T12:23:26.470279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24545/citation-record","integrity":"/paper/2505.24545/integrity","json":"/paper/2505.24545/citation-record.json","paper":"/paper/2505.24545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.705580Z","title":null,"venue":null,"work_id":"5315d043-907d-406b-93da-9f7466aa4b36","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.167552Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:847dff837c554c615ad6a3fa29befe8a7f3b6ca441bd6f5e5c00729293779500","observation_id":"fa6f38c3-d3bf-45dc-9408-30a1217e80c4","resolution":{"observed_at":"2026-08-07T12:23:31.824700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"cited_work":{"arxiv_id":"2505.24545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24545","snapshot_observed_at":"2026-08-07T12:23:26.439493Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","venue":"eess.AS","work_id":"25dd815c-0c4d-4978-8d28-a0b968fad9d1","year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.209433Z"},"links":{"cited_paper":"/paper/2505.24545","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:22af2e9edaebe56e7e26d1549debc8060611156869490338cd9d4f6e922e2cdf","observation_id":"7a67bcdb-cc66-49d2-bb45-d46264868983","resolution":{"observed_at":"2026-08-07T12:23:26.470279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.605380Z","title":null,"venue":null,"work_id":"c5996d5d-7492-44e7-8742-ed28d712150b","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.257239Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:3aaca42ea222c02a9f7715ba75cab9e1c9f5a0d27b017ce33c5cbf536214ef58","observation_id":"302b6b9b-cae0-4555-80a6-7fa951886a7e","resolution":{"observed_at":"2026-08-07T12:23:31.648141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.483352Z","title":"Dataset Table 1 lists the datasets used in our experiments, all monaural with a 16 kHz sampling rate and 16 bit depth","venue":null,"work_id":"9aa1f0ec-2eed-47dc-97b5-eb6749a2db12","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.292240Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:7d75ef94134b4a19aac9c2f63ad1d746af603d0305132c4656460011c257114c","observation_id":"04e71035-2c7e-4996-a8f3-55f81d408bf3","resolution":{"observed_at":"2026-08-07T12:23:31.551212Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7710.0015","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.353250Z","title":null,"venue":null,"work_id":"fe02487f-49e2-4b4a-b343-103bd6f90505","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.332072Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:f3835a366e7d57edca89bfdc6bb4e6d0fbce591c2d18a883ab0ceede56eff52c","observation_id":"7cc67e4a-0ad7-4932-898f-1fc177eef11b","resolution":{"observed_at":"2026-08-07T12:23:26.376459Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.287085Z","title":"The method is storage-friendly, simulation-agnostic, and outperformed diarization-based pre- training, with further gains from additional DIA pretraining","venue":null,"work_id":"573c0204-0856-4254-a3cd-88ca5c41b9f5","year":null},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.375554Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:3d78f9e31c63e27f39dd71642bb7c3afd0d8227b8bf0159df3680af356a41262","observation_id":"56c5e90b-284c-4297-9c08-33dc0cd619f1","resolution":{"observed_at":"2026-08-07T12:23:31.336895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.194470Z","title":"Front-end processing for the CHiME-5 dinner party scenario,","venue":null,"work_id":"32a42881-c3be-4081-ace9-db404387893d","year":2018},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.422764Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:5620fc241ed2f367d4cb2e09dde3750a9044acb85d659938819034ed09fc1a3d","observation_id":"b8809d20-5737-460d-a984-dbe51c289502","resolution":{"observed_at":"2026-08-07T12:23:31.232159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:31.092856Z","title":"BUT/JHU system description for CHiME-8 NOTSOFAR-1 challenge,","venue":null,"work_id":"4afd3fc1-f0e8-4ac9-bcd3-48e6a98d9430","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.466431Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:7e5a3403d0748d7cfb704410afd435ac05c693dfd8d0c19a93bf8ef30820edbd","observation_id":"b0c7ff37-6e07-4931-815b-d549eeaa551a","resolution":{"observed_at":"2026-08-07T12:23:31.130816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T12:23:24.503068Z","title":"Di- CoW: Diarization-conditioned whisper for target speaker auto- matic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.503068Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:530c89a8e4dce4428049586dc34c3f33909678ae34ea088964bad34f7d13511a","observation_id":"4fd78155-4eda-4b50-bdae-3aa0155d3660","resolution":{"observed_at":"2026-08-07T12:23:24.503068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.980948Z","title":"Bayesian HMM clustering of x-vector sequences (VBx) in speaker diarization: Theory, implementation and analysis on standard tasks,","venue":null,"work_id":"4bf8b699-1817-479f-9e7c-4c1fdecf01ba","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.556543Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:8f76c22e656105df8b58d00847d90a786a91112ef031cee7485e39546a85ed2c","observation_id":"8f0886cf-8faf-47d2-8ef1-b87c599b7fcc","resolution":{"observed_at":"2026-08-07T12:23:31.031489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.867062Z","title":"End-to-end neural speaker diarization with permutation-free objectives,","venue":null,"work_id":"23b1b920-7114-425b-bbfa-6a658ac97519","year":2019},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.607387Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:722acb8a6b26e8e84ea824ac2a429e458753e0c440c9481da79fc25de19e4c46","observation_id":"8a0c71fa-f231-4cc8-b515-78c5257bf4b9","resolution":{"observed_at":"2026-08-07T12:23:30.911215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.728580Z","title":"Integrating end-to- end neural and clustering-based diarization: Getting the best of both worlds,","venue":null,"work_id":"483797df-0e06-4927-ae1e-a97c14637972","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.642725Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:f659b24b23da9de7ea1247d8b5282c2635b5f5183cbc7d9b8a9ae39ab8a693ce","observation_id":"b3a0e7b8-0949-4373-89f4-314dfc595c78","resolution":{"observed_at":"2026-08-07T12:23:30.787427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.526521Z","title":"Towards neural diarization for unlimited num- bers of speakers using global and local attractors,","venue":null,"work_id":"60c88f62-f984-444a-a825-e6eb9ea03dad","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.676486Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:b0aefca95a061de5cb62acc28c0bf57f7d47ef35705e6556af61e19594aa9dec","observation_id":"eb4bbdf1-6d12-4cf3-a6cc-2fff10a74ebe","resolution":{"observed_at":"2026-08-07T12:23:30.621558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.310883Z","title":"pyannote.audio 2.1 speaker diarization pipeline: prin- ciple, benchmark, and recipe,","venue":null,"work_id":"b980ce6e-6f60-4f24-ab7c-7fc3f6b056fb","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.718602Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:f3e6f2a7236b3704fd5a17262e87e7131f7247af70dc560b2cb0c3fcccfd96eb","observation_id":"b398ad51-2fe1-4de3-8846-b22baa1f975f","resolution":{"observed_at":"2026-08-07T12:23:30.416238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:24.757297Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.757297Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:284dd284c30af0fea6025da60ab353780232595697995e3b6e40a57d5162e5cf","observation_id":"ec649530-f800-4d20-b183-f6c97078bb05","resolution":{"observed_at":"2026-08-07T12:23:24.757297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:30.047947Z","title":"End-to-end diarization for variable number of speakers with local-global networks and discriminative speaker embeddings,","venue":null,"work_id":"d564f192-c1fb-4e4b-ab94-4a27430c4d03","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.812647Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:764ad2e0d8db97e33fb71f86f090cb05eee6f50d1bac7d4bd4029ea3f047c534","observation_id":"96c7f9b9-a98b-413e-ab9f-fcfc510c4289","resolution":{"observed_at":"2026-08-07T12:23:30.194665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.834036Z","title":"Improving the nat- uralness of simulated conversations for end-to-end neural diariza- tion,","venue":null,"work_id":"6be969f3-19b1-4479-8433-f0334dff251a","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.859897Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:7393879fe4b827982f5fe47d45ea205cac4c8816c89028cacc3a2a123742c8e9","observation_id":"af22441e-1ddf-4bfd-ad56-afb18b638ad7","resolution":{"observed_at":"2026-08-07T12:23:29.935478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.643624Z","title":"From simu- lated mixtures to simulated conversations as training data for end- to-end neural diarization,","venue":null,"work_id":"b0459da2-4bf2-454c-bffe-1752f09f408c","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.909554Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:8864d6e6bfe735b000d33ce89dddfd4a6ef6cc057a5b5e6b7b505a22c8e7a5f6","observation_id":"4640bd14-4b51-4c7e-9f4f-2348443458ab","resolution":{"observed_at":"2026-08-07T12:23:29.733367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:24.948296Z","title":"Leveraging self-supervised learning for speaker diarization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.948296Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:6b7a217c39094b36f16aaf44a8db2ce58388ff21fa57699008b067d48a7ccab6","observation_id":"4866b203-bbb6-4968-96b2-47775bc03f2c","resolution":{"observed_at":"2026-08-07T12:23:24.948296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.462013Z","title":"Recursive attentive pooling for ex- tracting speaker embeddings from multi-speaker recordings,","venue":null,"work_id":"1ddbb958-a858-44b3-b380-d96931869030","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.986999Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:7c08ba4d2bd5e7d1c04695172c32c04aeb7e6855e082c222590c730b785a7412","observation_id":"2cdd0398-508a-47e6-8a3a-b80229a50690","resolution":{"observed_at":"2026-08-07T12:23:29.533149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.223408Z","title":"Frame-wise and overlap-robust speaker em- beddings for meeting diarization,","venue":null,"work_id":"b560bdc8-b150-4a3a-8b55-2bb23800b36e","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.042846Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:614324abd8d3a80d125a89259078c61335f842052d64142bc4e04ec5ed96eafe","observation_id":"dbd191cc-3ed4-4c50-bc9c-d252b9ec8d39","resolution":{"observed_at":"2026-08-07T12:23:29.327882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:29.009273Z","title":"Leverag- ing speaker embeddings in end-to-end neural diarization for two- speaker scenarios,","venue":null,"work_id":"9cd0ea81-ac0d-4bf6-a581-c97b1842d193","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.122201Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:ff7f741c059ccc398edf9adb525827137f95a44ae6edab264dc1900e5922a553","observation_id":"56bfb1df-580a-45e6-9424-d00bd60606d0","resolution":{"observed_at":"2026-08-07T12:23:29.093717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.791754Z","title":"ECAPA- TDNN: Emphasized channel attention, propagation and aggrega- tion in TDNN based speaker verification,","venue":null,"work_id":"38006425-acd8-45b6-bc50-2714c8028f7e","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.178936Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:18bfb31f07d4d9e34d03f92627466ccacfc99780ed0eb62fc7e51a3b0d91f899","observation_id":"6ca7aa5a-6933-4a38-8733-c216fca7ca2c","resolution":{"observed_at":"2026-08-07T12:23:28.859536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.671516Z","title":"Reshape dimensions network for speaker recognition,","venue":null,"work_id":"965fd4c7-e25b-4476-a633-e649d6480b48","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.221462Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:b2e8b50f4a5b92b2c077321798bc97dd6130d9679c682b924d163b69fe0c476b","observation_id":"1f3a1947-1320-4bcd-949c-0c8d2221052f","resolution":{"observed_at":"2026-08-07T12:23:28.722290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.531766Z","title":"Advances in inte- gration of end-to-end neural and clustering-based diarization for real conversational speech,","venue":null,"work_id":"e8d66a9c-4a91-4b4e-bd8b-b3ddce9c3e5e","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.263807Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:d46854068dccddd524ca367d6db3b6f85ce0fb58ecb380413ec9cc91c213fd91","observation_id":"de2e1446-1b7f-493e-a055-3a7700970a66","resolution":{"observed_at":"2026-08-07T12:23:28.588649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.377097Z","title":"BUT system for the Second DIHARD Speech Diarization Challenge,","venue":null,"work_id":"864b63ed-ad96-4def-bbf7-5e4a9d1b18f0","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.311513Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:74296e008fa719d64389702ddb449bc88a21fd2213262abb6cc88f270843d886","observation_id":"cd6c1782-ba22-4039-8b68-711ca17f8fd7","resolution":{"observed_at":"2026-08-07T12:23:28.417571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:28.192921Z","title":"Overlap-aware diarization: Resegmentation using neural end-to-end overlapped speech detection,","venue":null,"work_id":"fd6848ab-4b44-4b14-b4e0-39ae96d1497d","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.359230Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:d0b331c2e6ea0f68de620dfb13522d0ea245c881821eb714fa5feb7c5b42a801","observation_id":"4899405e-6860-4eee-9c96-7cdbbd5ed1ce","resolution":{"observed_at":"2026-08-07T12:23:28.252601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.984904Z","title":"End-to-end speaker diarization as post-processing,","venue":null,"work_id":"12f9305f-20d7-4642-82bb-7f249ba8f680","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.413374Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:7321e42e462fa7a13242943b8a46e8a16160679ad34760ff4e647429826dae9a","observation_id":"726fe55b-17bc-4a87-8b89-1090e5347b9d","resolution":{"observed_at":"2026-08-07T12:23:28.090233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:25.476790Z","title":"V oxCeleb: Large-scale speaker verification in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.476790Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:a9e1cf3124e34a700b5fb7d6a3ac4b61f079f2fce04a2aea60d238abcc9e4ebb","observation_id":"91cc6fbe-5938-4df6-ac68-07e0df910299","resolution":{"observed_at":"2026-08-07T12:23:25.476790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.814047Z","title":"AISHELL-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":"bea1f14a-ca77-4a50-8753-d9833c503773","year":2021},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.540343Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:fbf18bb89b16959a4b57de675c95b5f3ce6714ac24eedd48c902b88620c7ab26","observation_id":"34ab085d-3ddb-4273-a435-464d5cd83218","resolution":{"observed_at":"2026-08-07T12:23:27.876180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.697367Z","title":"M2MeT: The ICASSP 2022 multi-channel multi-party meeting transcription challenge,","venue":null,"work_id":"e40aea86-f357-417d-9769-33439e1a94fb","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.590807Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:9a511b3de597c1874259e22db583f5db76c3aff82f9bd46c34fcf8ecbc9d32b3","observation_id":"04b31024-6d93-4ea6-8fae-0f9dbfd7d4dd","resolution":{"observed_at":"2026-08-07T12:23:27.725928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:25.654858Z","title":"Unleashing the killer corpus: experiences in creating the multi-everything AMI Meeting Corpus,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.654858Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:12438bc116ac285e28419709a482b478e9fb35dd620a40101f880fd5c751e3ad","observation_id":"cbc61f7e-cf58-4393-ad8c-947602ca255f","resolution":{"observed_at":"2026-08-07T12:23:25.654858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.543425Z","title":"Open source MagicData-RAMC: A rich annotated Mandarin conversational (RAMC) speech dataset,","venue":null,"work_id":"89a566fe-c708-4aeb-9b54-d98349c497c9","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.689636Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:82f6d9be4826e9583206a4f1d914bd2532b4dd03ae44aac135e65bb100cebec5","observation_id":"f58573fb-f466-444b-9592-5939b85072ec","resolution":{"observed_at":"2026-08-07T12:23:27.586119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.444129Z","title":"MSDWild: Multi- modal speaker diarization dataset in the wild,","venue":null,"work_id":"1b0af471-d422-45d5-b488-c1fd151c788f","year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.732137Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:80c6a79470623750e0e8fc4f460e01fb9acb46cf02529aa707bbc03a9a8d06ad","observation_id":"4ec45dcc-566a-4e00-bb24-dc6159583a7f","resolution":{"observed_at":"2026-08-07T12:23:27.487926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.337086Z","title":"Spot the conversation: Speaker diarisation in the wild,","venue":null,"work_id":"0e72afaf-5e5a-4f65-916d-8809aaabc6f0","year":2020},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.780219Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:20cfe581457a0e5cf87d49b36533c3782d33ec7d17042c3864277867b3307070","observation_id":"2776752f-c287-48e1-9e9b-3223340ddcdd","resolution":{"observed_at":"2026-08-07T12:23:27.368891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.186505Z","title":"Mamba-based segmentation model for speaker diariza- tion,","venue":null,"work_id":"88ef2962-5f5f-43e2-9201-1e690ffec2c8","year":2025},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.841849Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:ab88c5bdece356326cecd628f6b4267df0a3e10ee0f375877edc9be9acb1200e","observation_id":"ab377e1a-3d41-4596-b408-a8823e459ddb","resolution":{"observed_at":"2026-08-07T12:23:27.268159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:27.029921Z","title":"FunASR: A fundamental end-to- end speech recognition toolkit,","venue":null,"work_id":"9b508278-8dea-4c8a-aae7-64036d0e415a","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.891003Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:c0bf5e6e24eaf72af18ee0b0956fc6a947c3e9a45a2b548f0069536c83274cee","observation_id":"5bb5f6e7-1629-4b54-8eec-8e3d1fc084f6","resolution":{"observed_at":"2026-08-07T12:23:27.127955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:25.928738Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.928738Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:dbcc24f123bd94e368880626f5362b1b77e7ba4c939d81d7023487dd6d1a2fac","observation_id":"e6d6392e-8038-4318-b0e3-6156ff8dcab9","resolution":{"observed_at":"2026-08-07T12:23:25.928738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.836213Z","title":"Speaker recognition from raw wave- form with SincNet,","venue":null,"work_id":"3fc7ac78-d607-40f3-85b2-d1dfcff3a5e6","year":2018},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:25.980172Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:6c349001ad1fa311b960d00bd01a85c4c12eb582806a73be1358a35cacda10c7","observation_id":"596f3de0-db7e-4c60-91eb-bfffefa9b36d","resolution":{"observed_at":"2026-08-07T12:23:26.902853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.036715Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:26.036715Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:c287222a3c2a25ceffb7244eb721950500c43024f42dde01eb661344294f18d0","observation_id":"45a5248f-e6c9-4385-a67a-f68767665b13","resolution":{"observed_at":"2026-08-07T12:23:26.036715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.708570Z","title":"pyan- note.audio speaker diarization pipeline at V oxSRC 2023,","venue":null,"work_id":"f7c2f8fd-3279-42f7-8c19-5c507f3ac12c","year":2023},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:26.099762Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:0e7c2c5595701feb2fa0840b78d06b3143808e286352631921199396571df005","observation_id":"b2d5bea5-8bfe-4d6a-b3db-4cb21d3cab49","resolution":{"observed_at":"2026-08-07T12:23:26.780187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:23:26.531352Z","title":"NTT speaker diarization system for CHiME-7: Multi-domain, multi- microphone end-to-end and vector clustering diarization,","venue":null,"work_id":"11d5ce7d-21f9-4632-b380-0e62fedf3491","year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:26.148077Z"},"links":{"citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:e1927823856152ee58e8bce7552bd3521a8101ffc0a6c4797b9e50bffeed2c9b","observation_id":"a57dcd30-dee0-4630-aebf-44ed39609dfa","resolution":{"observed_at":"2026-08-07T12:23:26.629779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2505.24545."}