{"as_of":"2026-08-15T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38317b7ac60b61f30a99d1260c3280a5f5bbed4d1d9b0f25329e18adebe988a2","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:17.272359Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:17.073394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:50:17.584368Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.12672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12672","snapshot_observed_at":"2026-08-07T00:50:17.584368Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","venue":"cs.SD","work_id":"ba7ade5b-745d-446e-bc22-1d1155b36d89","year":2025},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.073394Z"},"links":{"cited_paper":"/paper/2506.12672","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:979e1c7f9e28e8a7921155faca9eb30f7fe26d7a573a7e697375e7797e366cf4","observation_id":"1ad7751f-54f4-4b45-964d-2f03033599d5","resolution":{"observed_at":"2026-08-07T00:50:17.589525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12672/citation-record","integrity":"/paper/2506.12672/integrity","json":"/paper/2506.12672/citation-record.json","paper":"/paper/2506.12672"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.12672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12672","snapshot_observed_at":"2026-08-07T00:50:17.584368Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","venue":"cs.SD","work_id":"ba7ade5b-745d-446e-bc22-1d1155b36d89","year":2025},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.073394Z"},"links":{"cited_paper":"/paper/2506.12672","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:979e1c7f9e28e8a7921155faca9eb30f7fe26d7a573a7e697375e7797e366cf4","observation_id":"1ad7751f-54f4-4b45-964d-2f03033599d5","resolution":{"observed_at":"2026-08-07T00:50:17.589525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.936085Z","title":null,"venue":null,"work_id":"df6353fd-289c-4c3c-a31c-5dcfc3e7ec52","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.078666Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:d9872bc0bb9fda8a246960b57471031c67fdc74bf815d76df0b80e71081d3143","observation_id":"405de8c9-4626-4240-a43a-a36fe2cf999c","resolution":{"observed_at":"2026-08-07T00:50:17.942252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.919648Z","title":null,"venue":null,"work_id":"0078c70c-1b85-4029-b52b-7e33ede7b2f6","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.083516Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:316102b0a4384c46d6e53ef36318738c5b34609f504e8c7964509cb83e7d2164","observation_id":"cb0e5e3b-925e-4fc2-b02a-54fdf9ad3b7b","resolution":{"observed_at":"2026-08-07T00:50:17.924431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.903931Z","title":"Dataset The training set consists of LibriSpeech-360h [27], Libri2Mix, and Libri3Mix [28]","venue":null,"work_id":"f9200c75-bc3b-4a3a-9147-cf2413fcca71","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.088616Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:2590819bd4b9a5ba1c73a30299e16b52c9b2479d2159d725031806f117343b68","observation_id":"7807dc91-3110-48ba-93a3-5fe6d82d29ee","resolution":{"observed_at":"2026-08-07T00:50:17.909059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.871225Z","title":"Our proposed SC-SOT models, particularly when combined with multi-task learning (MTL), demonstrate promis- ing performance gains over the conventional SOT-based model","venue":null,"work_id":"ce5329b7-4617-44d7-a022-a8e59419fea0","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.099198Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:f684cfcbfc8a24a307409f86c3e11250b1d84f05c51e0c6368efc3f2e3198ca3","observation_id":"119c431a-5298-420b-bf3a-0621ff9ce989","resolution":{"observed_at":"2026-08-07T00:50:17.876339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.854598Z","title":"Our initial analy- sis, through visualization of source-target attention weights in an SOT-based model, revealed that the decoder performs a de- gree of speaker separation","venue":null,"work_id":"40813ae9-ba10-418f-83a6-40d0782f86b2","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.104148Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:17d1519f31f5634def7918478cbcc8704f57d978632f9e87caa7c8866b651d59","observation_id":"be4c3326-ae81-42a4-97e6-6d78eb03ccf4","resolution":{"observed_at":"2026-08-07T00:50:17.859960Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.110271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.110271Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:56fb14de63f7e518f00bdd63340476ea8c89293370dc043fdee87066730ab038","observation_id":"f73ff6b2-0cf5-4938-bc88-b1d7c2627bd6","resolution":{"observed_at":"2026-08-07T00:50:17.110271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.795488Z","title":"Sequence to multi-sequence learning via conditional chain mapping for mixture signals,","venue":null,"work_id":"4e41f584-71ba-46ba-b0e5-5546ac9263bb","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.151926Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:403b17103e7f34e527bd38518d220edab7c478f10fb38da7077421e4382eedcc","observation_id":"4af809b9-9acb-46bb-8a38-6b1edd2a03d4","resolution":{"observed_at":"2026-08-07T00:50:17.800507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.115011Z","title":"Recent advances in end-to-end automatic speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.115011Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:4af3d11153e064023ab3db40b5f836f7d536a073b2aee62db29641fd967c7cb7","observation_id":"8814306e-e349-45ff-9567-2150e2b26cc3","resolution":{"observed_at":"2026-08-07T00:50:17.115011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.820339Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":"6345266c-0983-4a8b-bd66-dd72d8a8968e","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.120316Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:1bc7c84c68485a648ef78f2529ad7169b71d02f4f49f3870a65f81b3a3ad9c41","observation_id":"f515b9f0-5c58-44cc-9342-61b398a66887","resolution":{"observed_at":"2026-08-07T00:50:17.824737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.125516Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.125516Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:665475de82f52d3353e62014bcabe9d43d62d121cdf2c7651e24dc6b7d4d2905","observation_id":"951bc0d5-095d-4279-ae7a-28ca126fdbea","resolution":{"observed_at":"2026-08-07T00:50:17.125516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09841","last_updated":"2024-04-16T14:55:13Z","snapshot_observed_at":"2026-08-14T13:08:06.020991Z","submitted_at":"2024-04-15T14:48:43Z","title":"Anatomy of Industrial Scale Multilingual ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09841","snapshot_observed_at":"2026-08-07T00:50:17.130311Z","title":"Anatomy of industrial scale multilingual asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.130311Z"},"links":{"cited_paper":"/paper/2404.09841","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:d474cc60ce14eaea35389244100561e6b47dfd07702dcedb9fd8942e82cb172d","observation_id":"a4ed4b4e-fe46-4103-a45f-71342bddb5d0","resolution":{"observed_at":"2026-08-07T00:50:17.130311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19674","last_updated":"2024-06-28T06:22:23Z","snapshot_observed_at":"2026-08-12T23:33:06.783203Z","submitted_at":"2024-06-28T06:22:23Z","title":"Less is More: Accurate Speech Recognition & Translation without Web-Scale Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19674","snapshot_observed_at":"2026-08-07T00:50:17.135316Z","title":"Less is more: Accurate speech recog- nition & translation without web-scale data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.135316Z"},"links":{"cited_paper":"/paper/2406.19674","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6066773f77407730417486f529a40237429d70d58f3974131ef1cc2e7f2384ad","observation_id":"86e970ca-86a7-4fdb-8db1-89a9f125a60d","resolution":{"observed_at":"2026-08-07T00:50:17.135316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.01985","last_updated":"2017-06-19T10:57:38Z","snapshot_observed_at":"2026-08-14T21:10:36.510771Z","submitted_at":"2017-03-22T08:39:32Z","title":"Recognizing Multi-talker Speech with Permutation Invariant Training","version":4},"cited_work":{"arxiv_id":"1704.01985","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.01985","snapshot_observed_at":"2026-08-07T00:50:17.524428Z","title":"Recognizing Multi-talker Speech with Permutation Invariant Training","venue":"cs.SD","work_id":"aebb5294-78a6-42ea-9c92-b7348ee5cbf1","year":2017},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.141353Z"},"links":{"cited_paper":"/paper/1704.01985","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:cc94c4e69ff04e400304d15a40d35e0e9f90392b9e336641fd27eac2ca3c1ba7","observation_id":"ed548814-085e-400f-9406-86d11342b4be","resolution":{"observed_at":"2026-08-07T00:50:17.529996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T00:50:17.146989Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.146989Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:ddcc36bbd46740eb793e6700f37419cd122d6eafd5fcdf6b8958f8e9b32cb483","observation_id":"d14078c9-7074-4944-a84a-b28828a3ee89","resolution":{"observed_at":"2026-08-07T00:50:17.146989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.722718Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"dcfcd4fe-60d1-4433-8c1b-031911e8b6b6","year":2019},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.191684Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:be5c36db0ef663af669f14f86efef216884499436405377f730440b867096e6b","observation_id":"ba27bf0b-135b-4fbe-bee4-cf7f94d8c084","resolution":{"observed_at":"2026-08-07T00:50:17.727622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-13T16:48:45.804832Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":"2202.00842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-07T00:50:17.484102Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","venue":"eess.AS","work_id":"9789dd90-d13b-4312-92e2-478bc726c11a","year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.156569Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:3f3b01580680d90424e90161f5cb0bf3ac9d4114b433c0d93f51635ae5346d5d","observation_id":"4ba06cd0-8d43-483b-b401-36c1d57ef1ef","resolution":{"observed_at":"2026-08-07T00:50:17.490013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.779196Z","title":"Surt 2.0: Advances in transducer-based multi-talker speech recognition,","venue":null,"work_id":"70a0a553-80a8-4c61-87ea-5fd6c617b963","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.161468Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:5f04e9ffe96fdbd39d8ba133ab5a8813d7bbb832f202ac7b0052f4ea95af850f","observation_id":"4376e618-bfce-4786-8f37-1467ab96e3f7","resolution":{"observed_at":"2026-08-07T00:50:17.784366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.763648Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"9cd90f84-5e2b-439c-a736-1559d020fbd1","year":2017},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.166023Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:e6ff9e418bfd70a95d19a40fe17575fd51d8ed75187ae15e6f8f4459d9db2978","observation_id":"d553db92-cce3-4a02-8e06-0f4d2aa68ca7","resolution":{"observed_at":"2026-08-07T00:50:17.768604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.05826","last_updated":"2018-05-15T14:45:33Z","snapshot_observed_at":"2026-08-14T19:15:06.743963Z","submitted_at":"2018-05-15T14:45:33Z","title":"A Purely End-to-end System for Multi-speaker Speech Recognition","version":1},"cited_work":{"arxiv_id":"1805.05826","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.05826","snapshot_observed_at":"2026-08-07T00:50:17.459260Z","title":"A Purely End-to-end System for Multi-speaker Speech Recognition","venue":"cs.SD","work_id":"1a63c333-f7fb-4a35-8f4b-b46019b454ba","year":2018},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.170341Z"},"links":{"cited_paper":"/paper/1805.05826","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:83da48e1f627dbd65c039feda609519e92420a6b33a4b4fd3af48e5575e5b935","observation_id":"2952a336-5482-45c4-bda7-03457cb27a32","resolution":{"observed_at":"2026-08-07T00:50:17.464512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.747473Z","title":"Mimo-speech: End-to-end multi-channel multi-speaker speech recognition,","venue":null,"work_id":"1af89bf3-a4ef-4bde-bf96-be8defb4deed","year":2019},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.176328Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:d36795a953e2b8323e11a06b1338cfe245261e49624566f683847dce7c39d943","observation_id":"ecf7c578-90f1-41d9-8383-166d59ebc84f","resolution":{"observed_at":"2026-08-07T00:50:17.752648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09921","last_updated":"2020-10-05T07:12:42Z","snapshot_observed_at":"2026-08-13T22:40:02.379515Z","submitted_at":"2020-05-20T09:08:41Z","title":"End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors","version":3},"cited_work":{"arxiv_id":"2005.09921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.09921","snapshot_observed_at":"2026-08-07T00:50:17.438413Z","title":"End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors","venue":"eess.AS","work_id":"c7bc827b-c940-45f3-87bd-4f6c0f1bb8f7","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.181573Z"},"links":{"cited_paper":"/paper/2005.09921","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:933b0d21ebd46025a3a84983f0b13d1d6c11cd878acf07ae23ce9bd7fac78e24","observation_id":"e6c902b3-0659-48a7-a629-effaa25cc403","resolution":{"observed_at":"2026-08-07T00:50:17.443388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.186901Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.186901Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:5aa2696f4c10fa759b2f17acbf61124cb303b13994dba574de5229c2615e3836","observation_id":"4017e837-3f20-4e2f-bc3e-58ec3e399815","resolution":{"observed_at":"2026-08-07T00:50:17.186901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.651466Z","title":"Transcribe-to-diarize: Neural speaker diariza- tion for unlimited number of speakers using end-to-end speaker- attributed asr,","venue":null,"work_id":"3f152a0c-84a2-42db-afa2-90bc179cc93d","year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.232416Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:879f165e49879ef9e4a31294b0310b31b9161c6bd6115a57c745388dad27b63a","observation_id":"380de5a2-eb45-4886-8511-bc397d5cc1be","resolution":{"observed_at":"2026-08-07T00:50:17.657506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.706343Z","title":"Adaptive blind audio source extraction supervised by dominant speaker identification using x-vectors,","venue":null,"work_id":"2667274e-feda-4eaf-b6d8-300ff0557b0b","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.196306Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:71056bee077731db094341b99969554ca6d4a39aaacd22d1e7941327f46f5a82","observation_id":"3c19fef3-ff92-49fa-a295-6b1fcd445f7a","resolution":{"observed_at":"2026-08-07T00:50:17.711415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07272","last_updated":"2020-07-27T13:28:20Z","snapshot_observed_at":"2026-08-14T15:04:28.001161Z","submitted_at":"2020-05-14T21:24:56Z","title":"Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario","version":2},"cited_work":{"arxiv_id":"2005.07272","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.07272","snapshot_observed_at":"2026-08-07T00:50:17.416959Z","title":"Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario","venue":"eess.AS","work_id":"19e30c97-5fcf-47e8-a912-f780b52dc106","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.200864Z"},"links":{"cited_paper":"/paper/2005.07272","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:210164f614a25163a7f8195a72cb07b68d4c1862f54037e934d3dee871232349","observation_id":"60b19474-c3ea-4af3-92ef-e7ba9ad5b911","resolution":{"observed_at":"2026-08-07T00:50:17.422697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.691535Z","title":"Tar- get speaker voice activity detection with transformers and its in- tegration with end-to-end neural diarization,","venue":null,"work_id":"488e5c41-bc37-4e2c-a4c2-b0d9782ab8ce","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.206891Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:b4a05832a8cd9491a2c7b6d66690cc4ef184f9e3861ccf6b3484add4c833ec23","observation_id":"866845d2-be7c-46f1-ad3c-b8423cd743d0","resolution":{"observed_at":"2026-08-07T00:50:17.696412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.677212Z","title":"Adapting self-supervised models to multi-talker speech recognition using speaker embeddings,","venue":null,"work_id":"c3dd9be7-35b4-49ea-a80f-982f153f0040","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.211578Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:5895cc071992d0b21c17fc6c6d09105b6af260ffd6f6ff1b413845519e05cf9b","observation_id":"7715e151-8ace-474f-a08c-23f071d90dab","resolution":{"observed_at":"2026-08-07T00:50:17.682041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.887162Z","title":"The Conformer encoder has 12 layers, while the Transformer decoder is structured with 6 layers","venue":null,"work_id":"eb50b547-cc40-41ff-b8fe-ffef55d1f1c1","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.093997Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:54615f740fca13c65a80c12341085fc2ccfca0ade53599c3aeae9587ea22c7bf","observation_id":"35cb56ab-2885-4e35-916f-a01a5f63ea7d","resolution":{"observed_at":"2026-08-07T00:50:17.892600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.216547Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.216547Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:d8a593f107c7a2de24691f77809a88a56ce38d21cc2d917738386d1d05ae99d7","observation_id":"09c22c77-82f4-48cd-a98f-8a49be71a03b","resolution":{"observed_at":"2026-08-07T00:50:17.216547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09543","last_updated":"2025-01-16T09:51:19Z","snapshot_observed_at":"2026-08-12T22:44:50.228752Z","submitted_at":"2024-09-14T21:46:00Z","title":"Target Speaker ASR with Whisper","version":2},"cited_work":{"arxiv_id":"2409.09543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09543","snapshot_observed_at":"2026-08-07T00:50:17.391298Z","title":"Target Speaker ASR with Whisper","venue":"eess.AS","work_id":"cd166029-8b76-4763-ba6b-2c08b9d9d66e","year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.222508Z"},"links":{"cited_paper":"/paper/2409.09543","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:db5446ba302c120329a40166ab2bc8d1820fe6af702866519f69f30608258d6f","observation_id":"1154dfe7-8571-4985-8f49-c0b593f47eeb","resolution":{"observed_at":"2026-08-07T00:50:17.399004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T00:50:17.227570Z","title":"Di- cow: Diarization-conditioned whisper for target speaker au- tomatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.227570Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:8950cecfb3d9c99f9cffba0e3b4b2ed5d6998425e24cc362ead26ce4b6718a0e","observation_id":"33eeac7b-ef79-4c00-9143-2aa993c6071f","resolution":{"observed_at":"2026-08-07T00:50:17.227570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.635222Z","title":"But/jhu system descrip- tion for chime-8 notsofar-1 challenge,","venue":null,"work_id":"d2c0c357-8684-4b72-b93f-fcb76d3220a0","year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.237094Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:7ad850f46c39eb56fad5b471bd3e76c40a00e24273b78c2ab02365664fe57c53","observation_id":"61ec0b16-5040-4d03-b1d6-95f7c08db808","resolution":{"observed_at":"2026-08-07T00:50:17.640268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00015","last_updated":"2018-03-30T18:09:39Z","snapshot_observed_at":"2026-08-14T19:30:36.364778Z","submitted_at":"2018-03-30T18:09:39Z","title":"ESPnet: End-to-End Speech Processing Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00015","snapshot_observed_at":"2026-08-07T00:50:17.242039Z","title":"Espnet: End-to-end speech processing toolkit,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.242039Z"},"links":{"cited_paper":"/paper/1804.00015","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:c9585032d02bda2e6acb58ad2986a43df0f098ff50fbeacc27c18063ae27bc85","observation_id":"068f07fe-08e1-42f7-8d45-08c3a86ec4d0","resolution":{"observed_at":"2026-08-07T00:50:17.242039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.620692Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"4628a7fb-4ac9-473b-b4f4-83c3c6611433","year":2015},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.246975Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6246a82f9976bd2db2ab8cf9e7aad8e861b78a0b8912534cb39c5958ae3d6988","observation_id":"4ddde7f5-7f1b-4edd-a0be-6f94237742de","resolution":{"observed_at":"2026-08-07T00:50:17.625398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-10T10:54:26.224254Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T00:50:17.251656Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.251656Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:d728100fb0db1d6b5608a78003878c969ccda60cdeb5250486d1a34c57d0c134","observation_id":"0123293d-e901-4c82-8787-7cce00d2debe","resolution":{"observed_at":"2026-08-07T00:50:17.251656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:50:17.256472Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.256472Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6150d6c5d9f851aa780c4b73fbb7c080f6adbd5eb3c31c46e659eff18f81d083","observation_id":"0fa73f01-3f40-4b90-a87c-e5527b34ac03","resolution":{"observed_at":"2026-08-07T00:50:17.256472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.262241Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.262241Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:fc68ad5e8ac24768b347d31f92cd96c8536833c7c36fd244784514d740979ce9","observation_id":"b39777e2-7e61-493e-9d59-8ffc4ff45661","resolution":{"observed_at":"2026-08-07T00:50:17.262241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.267393Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.267393Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:3efb1585e96135e380f69598cdb957bfa9bc502821e34b946a7ee6174066b502","observation_id":"38baa58f-d614-4712-8dd3-d8bce09ac4e2","resolution":{"observed_at":"2026-08-07T00:50:17.267393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:50:17.272359Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.272359Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:473ea3e8c9c76e7a5b3880f4aebdd316c69cf1b2cba81981e212329120710c01","observation_id":"63a2af0e-2c8b-4091-8761-28d663944392","resolution":{"observed_at":"2026-08-07T00:50:17.272359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":7,"verified_fuzzy":15},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2506.12672."}