{"as_of":"2026-08-17T18:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbb07f4b08f0b1e2e37d3f083f1b6031329e8eb81d438b016327a0fe3fb5c198","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:10:40.677516Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10143/citation-record","integrity":"/paper/2509.10143/integrity","json":"/paper/2509.10143/citation-record.json","paper":"/paper/2509.10143"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.514199Z","title":"Continuous speech separation with conformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.514199Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:35bb87627404553b425f2274b223d7ca17130995ec6a49889844bc0afc9e8ee8","observation_id":"81b91f03-1a3e-4c87-8574-31680bcf24c7","resolution":{"observed_at":"2026-08-04T18:10:38.514199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.589962Z","title":"Mixture encoder for joint speech separation and recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.589962Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:00e06e714604eee6a1c7a797ab5032637d4df8623533109f3d7d9eab08010182","observation_id":"9b489ac8-b125-46dd-9c6e-990251338edd","resolution":{"observed_at":"2026-08-04T18:10:38.589962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.676537Z","title":"Multi-turn rnn-t for streaming recognition of multi-party speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.676537Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:a50ca77a3dc45602cd6a6d751bd254859b4d60793654efb5ad28461ae6533d8e","observation_id":"3417e6ae-aeb9-4368-96f8-5f62ec8909ec","resolution":{"observed_at":"2026-08-04T18:10:38.676537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-16T17:24:13.596989Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-04T18:10:38.759180Z","title":"Streaming multi-talker ASR with token-level serialized output train- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.759180Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:053d00ae9dd87d9f5bffcbcad1ee092628604d607957e3477973cdf680d09b8f","observation_id":"30385cdf-1b12-43ca-a2a8-8ed326da73d0","resolution":{"observed_at":"2026-08-04T18:10:38.759180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.870161Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.870161Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:61b70393ea34cf66adfe8800da04c776064e183b4be2a98d2f2afb91fefff0ec","observation_id":"9b6b078e-5f70-4be2-a262-4685a8dd3f81","resolution":{"observed_at":"2026-08-04T18:10:38.870161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:38.954881Z","title":"TF-GridNet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:38.954881Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:476c7bf8bcf23173063b0f6c1948757f7ef7cc72c76d51ce8e15b34163197cce","observation_id":"92ce3ad9-29f1-4c8e-8fe5-3ac53f482f5b","resolution":{"observed_at":"2026-08-04T18:10:38.954881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.012615Z","title":"TS-SEP: Joint diarization and separation conditioned on estimated speaker embeddings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.012615Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:6b20025436ee6f0ab6d8d9c474f7a4dbb8a819ba783b707b08ee8dfa3224041d","observation_id":"f30a8c1b-5b4c-4cf0-8125-89fd3c7548f7","resolution":{"observed_at":"2026-08-04T18:10:39.012615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.098729Z","title":"M2Met: The ICASSP 2022 multi-channel multi-party meeting transcrip- tion challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.098729Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:37e1072fb5fbcb5e9fad7a14883b316c8086c5817e15d99044ae4660206a2790","observation_id":"f9378cd3-c9d8-486d-9d76-0801c900c6a0","resolution":{"observed_at":"2026-08-04T18:10:39.098729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.153160Z","title":"How bad are artifacts?: Analyzing the impact of speech enhancement errors on ASR,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.153160Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:86411d4581651d87e3b3bb8ccf38a1fd01d040e0a1df0b57a2ae09b9cc736286","observation_id":"00bdcc90-6aec-4a9e-b042-5533795c3725","resolution":{"observed_at":"2026-08-04T18:10:39.153160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.235099Z","title":"Impact of residual noise and artifacts in speech enhancement errors on intelligibility of human and machine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.235099Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:05305e09ce553e8440268bbc7661b699bc578695563f21285c9c698c29f62f10","observation_id":"549b5d3c-3cf4-4a43-9f58-ea7130bb9f7d","resolution":{"observed_at":"2026-08-04T18:10:39.235099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.317549Z","title":"Monaural source separation: From anechoic to reverberant environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.317549Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:bf57ee80c57a48811fb6ab308f704c7eb1466eb5b7acb26ca06b6ee32da7a46c","observation_id":"375abbde-9c4b-4169-a737-edf68eae8e97","resolution":{"observed_at":"2026-08-04T18:10:39.317549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.400331Z","title":"Explicit word error minimization using word hypothesis posterior probabilities,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.400331Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:32a1097e7cf59b8600ef621ce9c53c9f71edcdd05d8577aa583835b1c43e79ae","observation_id":"35a01af6-0c7d-487a-964e-a9db6e622226","resolution":{"observed_at":"2026-08-04T18:10:39.400331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.454327Z","title":"Con- fidence measures for large vocabulary continuous speech recognition,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.454327Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:caa904058c6f5c4ece6ac295edc29110be7ed6277a3e6dc6699be5e8a26c9eb2","observation_id":"4ddabb42-2a41-4b23-a410-351fb849b1b6","resolution":{"observed_at":"2026-08-04T18:10:39.454327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.538992Z","title":"Combining TF-GridNet and mixture encoder for continuous speech separation for meeting transcription,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.538992Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:fb5525820cf908f7ea0d4a01a1fb0167fceccc2556249abb7ebb9ac04cda363f","observation_id":"bc96ee97-ebd7-4a75-87e3-639bb18e04a1","resolution":{"observed_at":"2026-08-04T18:10:39.538992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.625107Z","title":"Recognizing overlapped speech in meetings: A multichan- nel separation approach using neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.625107Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:6afd55d5776c9c4d0ef6bafa022361652263aaa5038054083b640e2f5f0d6158","observation_id":"66b8bade-1646-4fe3-ab59-a7af7b9f1eaf","resolution":{"observed_at":"2026-08-04T18:10:39.625107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.707336Z","title":"TF-GridNet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.707336Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:b1a58b2017b75cb91972a4695f3648c48a310edc32970a8e1ad6f371fc2a455d","observation_id":"5345d1f5-699e-43b7-97b6-d8a5dcf4fc56","resolution":{"observed_at":"2026-08-04T18:10:39.707336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.791509Z","title":"Meeting recognition with con- tinuous speech separation and transcription-supported di- arization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.791509Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:a14c96ba8dd16221eb2063470c1d6c7042c19ed1a69609ba687dde2fda064524","observation_id":"c501d8c1-80e8-476d-bcb6-3fd6d3c6963c","resolution":{"observed_at":"2026-08-04T18:10:39.791509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.845750Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.845750Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:651f7fa6996a1417eea8d06f4f9f9bb8129a9400e6d90583e47e5a7e4c0db716","observation_id":"92e5f0f6-1c1f-4abb-88ba-5bb55a9cc080","resolution":{"observed_at":"2026-08-04T18:10:39.845750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:39.927965Z","title":"Integration of speech separa- tion, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:39.927965Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:91f3e51eaf438dd2f46930828f8b8619a1a44f85b478295d9da43e9608160036","observation_id":"bd73d1f9-474a-4cd6-999a-71d8bcc6ca43","resolution":{"observed_at":"2026-08-04T18:10:39.927965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.020375Z","title":"Once more diarization: Improving meeting transcription systems through segment-level speaker reassignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.020375Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:0a06c9444d1f8b6c99155dec621e391aee5cfa8aba35c048eef0e1dd26c8f219","observation_id":"ae8a23a4-3af4-4cd4-b4a0-da7a999f7e53","resolution":{"observed_at":"2026-08-04T18:10:40.020375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06667","last_updated":"2024-12-28T02:38:02Z","snapshot_observed_at":"2026-08-16T13:01:19.630896Z","submitted_at":"2024-11-11T02:23:08Z","title":"DCF-DS: Deep Cascade Fusion of Diarization and Separation for Speech Recognition under Realistic Single-Channel Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06667","snapshot_observed_at":"2026-08-04T18:10:40.078010Z","title":"DCF-DS: Deep cascade fusion of diarization and separation for speech recognition under realistic single- channel conditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.078010Z"},"links":{"cited_paper":"/paper/2411.06667","citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:5b27c0488376776199954fb4cfc76a49bdbb09f91c1d54891b61ad187678ad7a","observation_id":"76be257e-ad90-4e03-b668-4f3fda46443f","resolution":{"observed_at":"2026-08-04T18:10:40.078010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.157348Z","title":"MeetEval: A toolkit for computation of word error rates for meeting transcription systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.157348Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:a5b057cf77afbba135c920110b03f250527dbe4e7e6a7d39ab6ae095d693daa3","observation_id":"87c21bf6-8b17-43d6-85ab-2e5308e7384b","resolution":{"observed_at":"2026-08-04T18:10:40.157348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.238807Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.238807Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:49700f60a4708f0e61c65ee37760831d4e34b76cd71e863aa41c48c18b926e39","observation_id":"1fbd8dd8-80a2-4797-b78d-f4f1d0d9bd3a","resolution":{"observed_at":"2026-08-04T18:10:40.238807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13934","last_updated":"2019-10-30T15:39:31Z","snapshot_observed_at":"2026-08-10T05:16:38.868609Z","submitted_at":"2019-10-30T15:39:31Z","title":"SMS-WSJ: Database, performance measures, and baseline recipe for multi-channel source separation and recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13934","snapshot_observed_at":"2026-08-04T18:10:40.322325Z","title":"SMS-WSJ: Database, performance measures, and baseline recipe for multi-channel source separation and recognition,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.322325Z"},"links":{"cited_paper":"/paper/1910.13934","citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:fbd77d37d53d8e98910e8034345a042be659172c10907f7f8b4380d5e8cabceb","observation_id":"c699054d-36e7-4dd4-aede-b0776dd0b348","resolution":{"observed_at":"2026-08-04T18:10:40.322325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.405449Z","title":"Language mod- eling with deep transformers,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.405449Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:289c49e898059e2df1313e42007d771f14eba2fcf780e6efa94a61b28d7a4521","observation_id":"d920977f-7702-41cc-965b-5858e6b50eba","resolution":{"observed_at":"2026-08-04T18:10:40.405449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.488271Z","title":"Con- former: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.488271Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:04cb7825080a65a0ce98e75c515074c5a429a4e478ff5be7118d9fe5a2a5b225","observation_id":"ae4beec9-4e1f-4528-b7e4-06fd86d080b6","resolution":{"observed_at":"2026-08-04T18:10:40.488271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.576472Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech process- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.576472Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:f7a5625337b7216c0047ac1216a8d001674a04fb5171df1ba1585c488485e3ba","observation_id":"45e2cc10-4608-4fc7-91c5-9fb1c07307f8","resolution":{"observed_at":"2026-08-04T18:10:40.576472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:10:40.677516Z","title":"Performance measurement in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:10:40.677516Z"},"links":{"citing_paper":"/paper/2509.10143"},"observation_digest":"sha256:6d398adf2ac20434ee1b50859957e76b6001c8bb77f8be22a305700a5d3dd0b5","observation_id":"61ade70f-a860-49b4-aef1-71c4f9740ec5","resolution":{"observed_at":"2026-08-04T18:10:40.677516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10143","last_updated":"2025-09-12T11:10:38Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T08:32:17.820123Z","submitted_at":"2025-09-12T11:10:38Z","title":"Error Analysis in a Modular Meeting Transcription System"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.10143."}