{"as_of":"2026-08-16T00:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3682c2bfcdd7d5474cc2e4dba19c89131e61cc191bbeb64ee02c15bacd57b18","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:25:14.088343Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:25:11.153732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:25:14.576014Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"cited_work":{"arxiv_id":"2506.14204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14204","snapshot_observed_at":"2026-08-07T00:25:14.576014Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","venue":"eess.AS","work_id":"452bfb30-bff9-4e3b-906b-74018c9821ce","year":2025},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.153732Z"},"links":{"cited_paper":"/paper/2506.14204","citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:456eeadd847dfa1719363c641ae7fa89999fa81d0b6e17cf76d867c814855d57","observation_id":"6ac59759-3e08-4313-9f9c-91924f8bbea7","resolution":{"observed_at":"2026-08-07T00:25:14.796052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14204/citation-record","integrity":"/paper/2506.14204/integrity","json":"/paper/2506.14204/citation-record.json","paper":"/paper/2506.14204"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.429368Z","title":"However, the challenge of recognizing overlapping speech in multi-talker sce- narios remains a critical area of research","venue":null,"work_id":"9fc1c2ef-1821-4189-b4d5-12e298920b67","year":null},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.104804Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:b3e752abbe2a1f9247a21d1fd94a31a6f221d253688438ac45158aa6c43543bb","observation_id":"17609435-dd88-4d87-b18a-80565b52b05d","resolution":{"observed_at":"2026-08-07T00:25:19.432925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"cited_work":{"arxiv_id":"2506.14204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14204","snapshot_observed_at":"2026-08-07T00:25:14.576014Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","venue":"eess.AS","work_id":"452bfb30-bff9-4e3b-906b-74018c9821ce","year":2025},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.153732Z"},"links":{"cited_paper":"/paper/2506.14204","citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:456eeadd847dfa1719363c641ae7fa89999fa81d0b6e17cf76d867c814855d57","observation_id":"6ac59759-3e08-4313-9f9c-91924f8bbea7","resolution":{"observed_at":"2026-08-07T00:25:14.796052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.410069Z","title":"Avg. ” column. 0L and 0S are 0% overlap conditions with long and short inter-utterance silences. Column “CSS","venue":null,"work_id":"514d3a1d-5f96-4fbb-9406-0f0c4023cd64","year":null},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.302499Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:14ef1aaafcf2077c91dddbfb7833048b8bcc4ce2c7f27b065f3de0001fff294e","observation_id":"dc050b56-313c-4e70-9f5c-4ecdcaed6254","resolution":{"observed_at":"2026-08-07T00:25:19.413213Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.391104Z","title":"First, we leverage speech separated signals by using two channel CSS en- coder in our ASR models","venue":null,"work_id":"0f3e9df2-f932-4a01-858a-768e6db7835c","year":null},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.437698Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:2023f807d116593ce96b482c23000ca54cb17f4ffd8d1942842851fa86b723c9","observation_id":"b0ae8375-f4be-4ed1-bb36-82e558f03bfd","resolution":{"observed_at":"2026-08-07T00:25:19.394435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.400626Z","title":"Clearly, this model significantly outperforms the CT-tSOT model in row 2 across all scenarios","venue":null,"work_id":"12524303-958e-4084-9782-97b3d047e634","year":null},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.371923Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:04672a9168d5c42c7f4336473e9b9e82fb3f72490f99043822596d26b2cc1820","observation_id":"374f03fc-4644-414b-99dd-684c65d1c9aa","resolution":{"observed_at":"2026-08-07T00:25:19.403813Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.304304Z","title":"Continuous speech separation: dataset and analysis,","venue":null,"work_id":"52d8ea58-cca6-4635-9b7e-41054aafcc27","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.922157Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:9b8c34a9778b330d48b51a813cf09bc4526b533e3bc3035d8dddaa2cd9dc947e","observation_id":"094828e0-e881-4699-ae19-aed8ae57c985","resolution":{"observed_at":"2026-08-07T00:25:19.334387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.381819Z","title":"Recent advances in end-to-end automatic speech recogni- tion,","venue":null,"work_id":"17fd1b8a-243d-4853-8cc6-2874b3a00e41","year":2022},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.530032Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:f233a257833a80cf1b71b25782e9d6eeb970a6b8691e9c4801aa85b62568e5a7","observation_id":"ff11b036-779b-4206-a88c-99cf3cf7c00f","resolution":{"observed_at":"2026-08-07T00:25:19.384937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:11.612090Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.612090Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:15256a8941baf2a0cc8a7179d143d278bc12c86aa963416a5bf432e00fae1d7f","observation_id":"44ee7f40-c828-435e-9bfb-5a4d6a0507ba","resolution":{"observed_at":"2026-08-07T00:25:11.612090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.365962Z","title":"A streaming on-device end-to-end model surpassing server-side conventional model quality and latency,","venue":null,"work_id":"976afe8f-e0a0-4bea-8d29-9ce7c196ca9f","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.695533Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:8969b1491b9dfce685b0ce819fde0f20c93a024993c9b8160fb751e394d66301","observation_id":"53b917ff-5d68-4fbf-923e-7e8921d174ff","resolution":{"observed_at":"2026-08-07T00:25:19.369043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.352590Z","title":"Developing RNN- T models surpassing high-performance hybrid models with cus- tomization capability,","venue":null,"work_id":"22f9fad9-29ab-4714-a7a2-691c3c68387b","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.762507Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:bd2d3a5469c5b33982ab2cf6865e46db5306a1af45326097588b9b23cbb215b3","observation_id":"90b34695-2ec8-4f44-9358-952d70846d45","resolution":{"observed_at":"2026-08-07T00:25:19.358880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.342438Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"88345dc6-e372-473f-8a96-5166cd36b98c","year":2022},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.837004Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:15c1f45086e9e153f64e08905f3e95770cf2912279df6fbae6d168112e09aa98","observation_id":"5c7c17db-7681-4857-9843-743497f39d4a","resolution":{"observed_at":"2026-08-07T00:25:19.345872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:18.287681Z","title":"Streaming multi-talker ASR with token-level serialized output training,","venue":null,"work_id":"e02ac30d-810c-4d56-a500-5547c1d6cb3f","year":2022},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.301599Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:4f7fd1570282a137c7d9a53cdd607445318f819914579e9b7c721caa22b5263b","observation_id":"5dc1da24-8022-4cce-ab54-26ea26df6970","resolution":{"observed_at":"2026-08-07T00:25:18.351548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.173356Z","title":"Integration of speech separation, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis,","venue":null,"work_id":"3a8c5d29-3582-4dc4-8918-44a69fdc30bf","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.007478Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:11b6445f6c6e15a7e26593e271aaf7784942519dec3b90ff2e0cb6c43e47f468","observation_id":"58ea0287-25a2-4cd5-814e-4607eae42a51","resolution":{"observed_at":"2026-08-07T00:25:19.247621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.006845Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"8f163ab5-682b-4d13-a1da-c98a85814ded","year":2017},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.058115Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:20d8e79d24f84cf98732a8b46fc962425e032a5f563fc75fc0ed60431d1c0e91","observation_id":"7641a0d2-6c85-49a2-999d-c6ebf8d76ca2","resolution":{"observed_at":"2026-08-07T00:25:19.163355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:18.687095Z","title":"Recognizing multi-talker speech with permutation invariant training,","venue":null,"work_id":"9c17bb09-93f1-4314-a65c-81daa220562b","year":2017},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.138836Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:76d9a83f0ef7b685acc960d7ed4e68407c3feadfbc03c58b63d7079de41e78bb","observation_id":"b0b0ec89-5b07-4517-97c2-ee39ab7eba34","resolution":{"observed_at":"2026-08-07T00:25:18.836259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:19.419788Z","title":"Figure 2:Conformer Transducer with Multi-Talker Cascaded Encoder","venue":null,"work_id":"2f688acd-82c3-4437-b5bc-681e0310a88a","year":null},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:11.219046Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:36bbabb518ad1109f1deec6b501fe546ff89eaf0fb8986144249ba3b963e1f54","observation_id":"7e7bfa55-b636-470b-a7dd-3e883a10abcd","resolution":{"observed_at":"2026-08-07T00:25:19.422910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:12.182783Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.182783Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:a9848d7b271fc27001b8b923c301ab850db3ff55acff716ac267728faddcd9b9","observation_id":"e4a1df3e-3b8a-40c8-8934-94486baaf80e","resolution":{"observed_at":"2026-08-07T00:25:12.182783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:18.417404Z","title":"Rec- ognizing overlapped speech in meetings: A multichannel separa- tion approach using neural networks,","venue":null,"work_id":"8f9209ea-aeec-422c-ae6c-c298f8fa6f0a","year":2018},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.206262Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:71973fd2724bc6ebd1ce9e2f1686f42f771ec6e969ca92e2076ea2334a163f3b","observation_id":"a8d149a5-e6bb-4edc-9346-b6fcc1bf9619","resolution":{"observed_at":"2026-08-07T00:25:18.522978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:18.116489Z","title":"Speech separation with large-scale self-supervised learning,","venue":null,"work_id":"de48d252-fabc-4926-a0b2-576eb6b6dc73","year":2023},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.371398Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:d7dcc913a84ba0f1f5e6ff0638951f55d60c36a3b6ebe63f26680e8ab1cf9c60","observation_id":"8821ce48-5924-452b-a494-017c7448fae0","resolution":{"observed_at":"2026-08-07T00:25:18.207138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:17.932465Z","title":"MIMO-Speech: End-to-end multi-channel multi-speaker speech recognition,","venue":null,"work_id":"b0265d65-2e76-4ed9-8578-c25d1c1425ef","year":2019},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.410546Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:3faf9c6c7f6afabe13c7ffd605146697dca1b4afffdf0521da5963204bb79d73","observation_id":"41310359-94db-4e23-b846-8f46bb6ac63a","resolution":{"observed_at":"2026-08-07T00:25:18.017941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:17.754602Z","title":"Directional ASR: A new paradigm for E2E multi-speaker speech recognition with source localization,","venue":null,"work_id":"e9a9369c-134d-4da2-85fb-10cc3a26cde2","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.542403Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:cf44529991a4017e3d72e7d681666976d6b2388d03d6f61a40cd82e1e878c767","observation_id":"85eaf911-914c-4e36-bb23-f6e0a365c14f","resolution":{"observed_at":"2026-08-07T00:25:17.836005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:17.587867Z","title":"VarArray meets t-SOT: Advancing the state of the art of stream- ing distant conversational speech recognition,","venue":null,"work_id":"99f61f22-c77b-41fe-b185-43456558abc5","year":2023},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.651288Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:80ff64fae9d6694ad1d138f4a4e4ce10b9d6e3472f340cc87a7dd6c36d4f3a2d","observation_id":"e831f744-112f-4105-a331-d4b0176edca2","resolution":{"observed_at":"2026-08-07T00:25:17.651858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:17.428880Z","title":"End-to-end multi-speaker speech recognition with transformer,","venue":null,"work_id":"eb27d4e9-fa26-4059-aae6-9bdc7db3e12a","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.703582Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:362140f760843482bc5a087ec8e3e464cc40893e91d1545a08d61ba9c39bc467","observation_id":"dd45a35d-d79b-4119-9662-38c566091302","resolution":{"observed_at":"2026-08-07T00:25:17.507989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:17.278845Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"6b01fddb-b2a2-4569-ab7a-5dd8adb4d74e","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.808464Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:3c43a056b6475ba5581c8742583d1223c1634eeb796e264d45b9c4a85486aa88","observation_id":"bfd09a9b-d49e-4d32-b0fc-2a0fc3c8789a","resolution":{"observed_at":"2026-08-07T00:25:17.356621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:17.129717Z","title":"Developing real-time streaming transformer transducer for speech recognition on large- scale dataset,","venue":null,"work_id":"669ce4d6-f108-49fb-b634-9d5d2ef8da43","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:12.888888Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:f7bf5eb3b0a6121c5c144af3b416fca83f659762bd565c587d5649440ed1823b","observation_id":"bea94d92-8c63-4f02-8bbe-cdf215b9f84e","resolution":{"observed_at":"2026-08-07T00:25:17.206613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.1602","last_updated":"2014-12-04T10:00:19Z","snapshot_observed_at":"2026-08-14T23:08:59.739079Z","submitted_at":"2014-12-04T10:00:19Z","title":"End-to-end Continuous Speech Recognition using Attention-based Recurrent NN: First Results","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.1602","snapshot_observed_at":"2026-08-07T00:25:13.014632Z","title":"End-to- end continuous speech recognition using attention-based recurrent NN: First results,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.014632Z"},"links":{"cited_paper":"/paper/1412.1602","citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:3b42df50061d2623eee10aa15e904d3d1351932220fa4625e5c4252236e848f5","observation_id":"f4629428-c691-4067-815c-3d959b1c824a","resolution":{"observed_at":"2026-08-07T00:25:13.014632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:16.972149Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":"b9df65e7-e84c-452f-9b52-4ce868760624","year":2016},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.071856Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:8b948a8e2b8afa4e07dccb56d9753fb1e4a3fbcfe9c57b32d89a666c833efddb","observation_id":"7a2c18b8-95df-4fc7-b461-51197c454355","resolution":{"observed_at":"2026-08-07T00:25:17.059275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:16.789812Z","title":"Cascaded encoders for unifying streaming and non-streaming ASR,","venue":null,"work_id":"6a436390-046a-41bc-9df0-5cc989f98f2b","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.144245Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:cc7c605612b82fc8d757bc38832ca67737334356edfb116cf159ed0bb827de82","observation_id":"9de94e1e-ff3d-4423-8f1d-ff0cd18b7326","resolution":{"observed_at":"2026-08-07T00:25:16.876718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:16.604175Z","title":"Continuous speech separation with con- former,","venue":null,"work_id":"66be7ba7-74ab-4e73-a6b8-bc45aaa03105","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.216206Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:da81210a94a9ac784942932d54c4539a56cdec8e4014b37baca1c004b84c6498","observation_id":"4d5f32ed-e341-4bcd-ad64-e3fb68ca3c44","resolution":{"observed_at":"2026-08-07T00:25:16.694122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:16.433707Z","title":"Joint speaker counting, speech recognition, and speaker identification for overlapped speech of any number of speakers,","venue":null,"work_id":"95fb5ca8-f0a7-420c-812f-b23361a49a24","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.325547Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:b868afdcacb6ae65cbcf373058dfe28de414934c46d3f91aca0281e321f1271b","observation_id":"f92627fb-4000-42c5-9777-7f6a30fdff3a","resolution":{"observed_at":"2026-08-07T00:25:16.500799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:16.262824Z","title":"Investigation of end-to-end speaker-attributed ASR for continuous multi-talker recordings,","venue":null,"work_id":"46f22d10-a942-4945-bb0c-d2d01e93c503","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.387053Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:1826e5babdfe5a977b1ac9a38eaf70d560d9df6865bde0f8053d552118f4634e","observation_id":"9541bc28-c7a5-457c-8a7a-1aba80653a23","resolution":{"observed_at":"2026-08-07T00:25:16.341036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:16.120263Z","title":"Joint CTC-attention based end-to-end speech recognition using multi-task learning,","venue":null,"work_id":"43510f34-c457-461f-a10a-d9c303444fc7","year":2017},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.457586Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:943fdbf90ea101f0278b1472b5ad290e16863c26acdf8578f8a01a289dc85296","observation_id":"09f0485f-d3e8-4147-9a37-7c038e489e56","resolution":{"observed_at":"2026-08-07T00:25:16.189953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:15.911554Z","title":"High-accuracy and low-latency speech recognition with two-head contextual layer trajectory LSTM model,","venue":null,"work_id":"c1c1f029-d112-41fd-aaf0-56615d78ec69","year":2020},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.540695Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:2a0c283f482e1997701e667482939b19da4fc8801920498026674cd60b3b08d6","observation_id":"ced51003-9cca-423f-8e83-2fc40c78685b","resolution":{"observed_at":"2026-08-07T00:25:16.008079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:15.682915Z","title":"The AMI meeting corpus: A pre- announcement,","venue":null,"work_id":"1d574356-001c-487c-824a-22a6748db8a5","year":2006},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.615086Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:9e626308b38e67bd8025240752932674143aa9be721537ecd9431e6654a57513","observation_id":"7d6260b2-bf6c-44c3-a4b4-21f3d1b4747d","resolution":{"observed_at":"2026-08-07T00:25:15.804992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:15.483537Z","title":"The ICSI meeting corpus,","venue":null,"work_id":"2aeb9e26-5afc-46a2-8782-6c7a38820e2f","year":2003},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.711094Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:d63774d3f322473963d128c261c583241f4d2ae5745c3c179866677fa2f8af39","observation_id":"11d42dff-65b2-4f51-85a2-71cfa4df692c","resolution":{"observed_at":"2026-08-07T00:25:15.576909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:15.228541Z","title":"The NIST Scoring Toolkit (SCTK),","venue":null,"work_id":"7213d8a1-1f5a-43ec-bd0e-b0d501572a72","year":2021},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.795693Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:1afbe5b1012a269adf3d0dc12e89b5428b05b37e9c16714a9c5f2d3bea6b64d8","observation_id":"b0e05795-c22a-42df-8950-ffe751988e63","resolution":{"observed_at":"2026-08-07T00:25:15.339241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:13.906564Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.906564Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:a1feab1d2d1328c35e5ec8d2082c4acb552ff9bd9321493b8afa58622f1f15de","observation_id":"6436fc04-8ad3-4c5d-92c3-d361bb3c3fac","resolution":{"observed_at":"2026-08-07T00:25:13.906564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06493","last_updated":"2023-05-31T02:36:44Z","snapshot_observed_at":"2026-08-13T13:44:22.833469Z","submitted_at":"2022-11-11T22:07:43Z","title":"Handling Trade-Offs in Speech Separation with Sparsely-Gated Mixture of Experts","version":2},"cited_work":{"arxiv_id":"2211.06493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.06493","snapshot_observed_at":"2026-08-07T00:25:14.303533Z","title":"Handling Trade-Offs in Speech Separation with Sparsely-Gated Mixture of Experts","venue":"eess.AS","work_id":"5d06f289-d7a3-4b54-9d1b-ef98815c612f","year":2022},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:13.997966Z"},"links":{"cited_paper":"/paper/2211.06493","citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:5bd84fc4e151e06d64e6012f75fa087c6419fdfcd1113ed81983b0265aeba8c4","observation_id":"0a2e3f95-6411-428b-8f0f-65808b4eae26","resolution":{"observed_at":"2026-08-07T00:25:14.387880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:25:14.932568Z","title":"Improving wideband speech recognition using mixed-bandwidth training data in CD- DNN-HMM,","venue":null,"work_id":"4df458a5-18fa-48c8-821c-e7dfc99fa19a","year":2012},"citing_paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:14.088343Z"},"links":{"citing_paper":"/paper/2506.14204"},"observation_digest":"sha256:40d5f6a0f0f404055a81487bc09a9edce54e3a1358344e9c23cf3ed8a2387df5","observation_id":"520496b5-07e4-401c-adb4-f49cf4309d22","resolution":{"observed_at":"2026-08-07T00:25:15.063030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14204","last_updated":"2025-06-17T05:46:38Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T00:39:48.835522Z","submitted_at":"2025-06-17T05:46:38Z","title":"Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.14204."}