{"as_of":"2026-08-17T18:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acbd433b388d45206e0319ab99c8de3b01341a99db0732030dab9ac9bac5f87f","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:31:48.143276Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.10456/citation-record","integrity":"/paper/2508.10456/integrity","json":"/paper/2508.10456/citation-record.json","paper":"/paper/2508.10456"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.040946Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.040946Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5115eb660b1d6f401f5b634dadd1c777d2bb2886ca298739b23c6436019a613e","observation_id":"11db9d7c-8e3b-4198-a6bc-1b8e5fffbb68","resolution":{"observed_at":"2026-08-05T20:31:39.040946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.145089Z","title":"Hybrid ctc/attention architecture for end-to-end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.145089Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d960317ab11626a08ec7004370ab36f591c629201403476d987a65b9bad45997","observation_id":"f7f1ea8e-1476-4043-9d28-2b0aa8db8904","resolution":{"observed_at":"2026-08-05T20:31:39.145089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.228233Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.228233Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cb26a2ad61a4f3163051441d94f1e2002aa49d2138628d8876ff1b846f647ab2","observation_id":"2095d3b1-e8d6-49e8-afab-564009151f8f","resolution":{"observed_at":"2026-08-05T20:31:39.228233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.340737Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.340737Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5dad3733ff0b40c61ae060d89985c12d4052484c74755b04d2913ef481ccc2ea","observation_id":"b4c69068-b269-4da4-9bc8-7ac0012145a2","resolution":{"observed_at":"2026-08-05T20:31:39.340737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.447669Z","title":"Speech-transformer: a no-recurrence sequence-to- sequence model for speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.447669Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f5b4ca0fd71d5849f884a30f785dc74b599fd6de30d72617e27eb56d0af03c9f","observation_id":"ab75db89-276c-470b-9458-8c626c82fc0f","resolution":{"observed_at":"2026-08-05T20:31:39.447669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.537168Z","title":"A comparative study on transformer vs rnn in speech applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.537168Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:9f7a8070db2a109dc079593a61b3d11b7673d6897e2449934a5d986356690e6b","observation_id":"e1fd1b12-f44a-4d9d-bafc-2a70d90e6f47","resolution":{"observed_at":"2026-08-05T20:31:39.537168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.633846Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.633846Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0843f0922f13a22c72af4826d136d42dcad9819c7bfd889392b788bd8d4b7728","observation_id":"4bee5d7f-62eb-48c2-82d2-5097c1aac52e","resolution":{"observed_at":"2026-08-05T20:31:39.633846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.712245Z","title":"Recent developments on espnet toolkit boosted by conformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.712245Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8e65bcfddcf584b6e872e821e29be3a96186460689b6c5566bb7d8ce89cfceb7","observation_id":"d2390ca1-8927-4b0a-acd4-f2140f2dfb33","resolution":{"observed_at":"2026-08-05T20:31:39.712245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T20:31:39.796983Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.796983Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:3eca6617843f973058fec2ebe2a03fb8daf87f349d0779cd1f2b4aa75ef2f895","observation_id":"e7c11225-302e-4ce8-bc5e-05b7baf6788f","resolution":{"observed_at":"2026-08-05T20:31:39.796983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.914416Z","title":"Recurrent neural networks,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.914416Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7c745f91ee172fa239583079fb2f9e197d71ca19f095d294c4144a5f20c6818b","observation_id":"047e0586-806e-42cd-81aa-7574d9fa98cd","resolution":{"observed_at":"2026-08-05T20:31:39.914416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1402.1128","last_updated":"2014-02-05T19:01:51Z","snapshot_observed_at":"2026-08-17T13:26:41.306451Z","submitted_at":"2014-02-05T19:01:51Z","title":"Long Short-Term Memory Based Recurrent Neural Network Architectures for Large Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1402.1128","snapshot_observed_at":"2026-08-05T20:31:40.032849Z","title":"Long short-term memory based recurrent neural network architectures for large vocabulary speech recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.032849Z"},"links":{"cited_paper":"/paper/1402.1128","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:b0d9d6f899f9be739b3194fa19445e6e631aec92506110c38ccd13f1e23a0546","observation_id":"3c41ce41-2d7b-4270-a270-7a0ebda4a6d8","resolution":{"observed_at":"2026-08-05T20:31:40.032849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.112682Z","title":"Efficient training of neural transducer for speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.112682Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5d5fba69257c0f2c25d783a7989ea20a3f91d4d46c568844adeb610215a8b201","observation_id":"6d4faef4-48f6-4892-a2c7-dc86704e821e","resolution":{"observed_at":"2026-08-05T20:31:40.112682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.213383Z","title":"On the limit of english conversational speech recog- nition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.213383Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:88d39011265ddbe79b5b7220cec051fd90e7758be954d658d32ba9fc0889c125","observation_id":"995b2255-cb3e-47ef-98d0-352f5904b3aa","resolution":{"observed_at":"2026-08-05T20:31:40.213383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.327114Z","title":"Improving the training recipe for a robust conformer-based hybrid model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.327114Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:bc84d4c6ad943ef00b98638a1b751cec50fc674bc46a2e3406f04fbb3676630e","observation_id":"7146709b-3bbc-4ffe-be3a-99477a6906f5","resolution":{"observed_at":"2026-08-05T20:31:40.327114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.415984Z","title":"Confidence score based conformer speaker adaptation for speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.415984Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d76b726d8ea40540489184e824622555b2e76071bbaefd42456c4cad3144eeff","observation_id":"9cd39ca8-bd36-4e63-9213-3cfcdf89c110","resolution":{"observed_at":"2026-08-05T20:31:40.415984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14120","last_updated":"2023-02-27T20:08:36Z","snapshot_observed_at":"2026-08-16T15:52:17.971665Z","submitted_at":"2023-02-27T20:08:36Z","title":"Diagonal State Space Augmented Transformers for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2302.14120","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14120","snapshot_observed_at":"2026-08-05T20:31:51.151579Z","title":"Diagonal State Space Augmented Transformers for Speech Recognition","venue":"eess.AS","work_id":"9e919a8e-a54a-4583-9c6a-421e15ee2be5","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.515370Z"},"links":{"cited_paper":"/paper/2302.14120","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a35fe900269b11146c884c333ea03a3e90ae5d5d0c2715c40382b09c920732d5","observation_id":"00bb68b6-2a8c-4174-b0bf-d35ecab8dbb3","resolution":{"observed_at":"2026-08-05T20:31:51.243108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.601112Z","title":"Recent advances in end-to-end automatic speech recog- nition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.601112Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:35e6bbc0fb54808f0ae459427bbf383354eb39fd9b7ed9579aa96f3c248d88fe","observation_id":"0617d538-d4e0-42ce-b3bd-101d1af0fe27","resolution":{"observed_at":"2026-08-05T20:31:40.601112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00883","last_updated":"2022-07-02T17:17:47Z","snapshot_observed_at":"2026-08-16T16:48:46.195326Z","submitted_at":"2022-07-02T17:17:47Z","title":"Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism","version":1},"cited_work":{"arxiv_id":"2207.00883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00883","snapshot_observed_at":"2026-08-05T20:31:50.852399Z","title":"Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism","venue":"cs.SD","work_id":"2b2b1b9a-4369-4654-a5af-6226105cc4af","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.689037Z"},"links":{"cited_paper":"/paper/2207.00883","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:374088a9f0535963d479896c0021701b4dc740ead24d35a589279d9f0a50acbf","observation_id":"0bcb61f5-291a-410e-b19c-38ee77418444","resolution":{"observed_at":"2026-08-05T20:31:51.028105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.773045Z","title":"Improving asr contextual biasing with guided attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.773045Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7ae396370830eae700cc893a901824e61907a79aed2e8f660c4fbbbaffccd657","observation_id":"ec1cfdea-1210-4095-8423-246400ab3e25","resolution":{"observed_at":"2026-08-05T20:31:40.773045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.851093Z","title":"Optimizing byte-level representation for end-to-end asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.851093Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:89386bf37cd9281b775883bf2c141088a59d4624a740f6d929503265971fee93","observation_id":"0d3c780a-92b5-4b2b-8207-abaff055228d","resolution":{"observed_at":"2026-08-05T20:31:40.851093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.979654Z","title":"Contextual modeling for document-level asr error correction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.979654Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5971acdf958ce354f3e347402240021d5a2ddd72f5b9b3478be51dc4ad88ee7b","observation_id":"d9907ec3-f172-4699-9634-6a4165bf1ed9","resolution":{"observed_at":"2026-08-05T20:31:40.979654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:41.065159Z","title":"Promptasr for contextualized asr with controllable style,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.065159Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:dd7011100ea768e851ef9e93cf831787832a02eca50b05d57ea448fac9b43cb4","observation_id":"9c199e58-a953-4b7a-9239-740734c6c521","resolution":{"observed_at":"2026-08-05T20:31:41.065159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:41.143119Z","title":"Conversational speech recognition by learning audio- textual cross-modal contextual representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.143119Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a37a1f6a76c3f23d35fc110dea2d3dc9f0a3bb87f7568bbc177a7404c7d883c4","observation_id":"6f881a35-e3a6-4ae2-80d2-cd350f18f212","resolution":{"observed_at":"2026-08-05T20:31:41.143119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:41.229606Z","title":"Dual-mode nam: Effective top-k context injection for end-to-end asr,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.229606Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0dc7169811e11740e0c58804a55313e9bb544b49403e61fdd2c70ece61def333","observation_id":"5efe2905-0318-4095-96cc-99e8f0f248b1","resolution":{"observed_at":"2026-08-05T20:31:41.229606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07413","last_updated":"2023-09-21T03:02:27Z","snapshot_observed_at":"2026-08-16T15:00:52.043978Z","submitted_at":"2023-09-14T03:40:14Z","title":"CPPF: A contextual and post-processing-free model for automatic speech recognition","version":2},"cited_work":{"arxiv_id":"2309.07413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07413","snapshot_observed_at":"2026-08-05T20:31:50.649121Z","title":"CPPF: A contextual and post-processing-free model for automatic speech recognition","venue":"cs.CL","work_id":"462244e5-9d1f-47ad-ba4f-1148e509bbfd","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.333464Z"},"links":{"cited_paper":"/paper/2309.07413","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c08f74fa8048e356fb41f04702b30eefc74a26ef5090c8b1df4cae3f972b73f9","observation_id":"3e8e1dbc-1089-4d79-ab86-e7db061ad785","resolution":{"observed_at":"2026-08-05T20:31:50.766549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12459","last_updated":"2023-05-21T13:32:19Z","snapshot_observed_at":"2026-08-16T15:31:21.755246Z","submitted_at":"2023-05-21T13:32:19Z","title":"CASA-ASR: Context-Aware Speaker-Attributed ASR","version":1},"cited_work":{"arxiv_id":"2305.12459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12459","snapshot_observed_at":"2026-08-05T20:31:50.439220Z","title":"CASA-ASR: Context-Aware Speaker-Attributed ASR","venue":"eess.AS","work_id":"fc02ee6b-843d-4857-8bfd-ca825ff6e408","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.404760Z"},"links":{"cited_paper":"/paper/2305.12459","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:6c09c9f4256f9790427e5edc90d1d97990c029515838147b0035529be6bd310e","observation_id":"71a14c27-013a-4ac2-9140-e92a55b71557","resolution":{"observed_at":"2026-08-05T20:31:50.531977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02736","last_updated":"2023-01-06T22:32:50Z","snapshot_observed_at":"2026-08-16T16:03:56.526720Z","submitted_at":"2023-01-06T22:32:50Z","title":"Using External Off-Policy Speech-To-Text Mappings in Contextual End-To-End Automated Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02736","snapshot_observed_at":"2026-08-05T20:31:41.493267Z","title":"Using external off-policy speech-to-text mappings in contextual end-to-end automated speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.493267Z"},"links":{"cited_paper":"/paper/2301.02736","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:bcb4a1c9381220af8dca05c21d5b83b0d44a581d4de7d576d062c71dbbfcb283","observation_id":"593b9995-e5c3-43dc-8322-202f0bcb9e72","resolution":{"observed_at":"2026-08-05T20:31:41.493267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:01.145127Z","title":"Bring dialogue-context into rnn-t for streaming asr,","venue":null,"work_id":"ef6538c3-7163-4a7b-b890-f8bf0ed17082","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.598588Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5f8d74412c13bea02834353c8fee77765814d70ccec28faeafccb8c2a99daef7","observation_id":"461d666f-6e32-4906-83d4-166bd3dec097","resolution":{"observed_at":"2026-08-05T20:32:01.257605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12839","last_updated":"2024-05-27T06:35:36Z","snapshot_observed_at":"2026-08-16T15:31:10.947866Z","submitted_at":"2023-05-22T09:03:11Z","title":"CopyNE: Better Contextual ASR by Copying Named Entities","version":2},"cited_work":{"arxiv_id":"2305.12839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12839","snapshot_observed_at":"2026-08-05T20:31:50.141909Z","title":"CopyNE: Better Contextual ASR by Copying Named Entities","venue":"cs.CL","work_id":"38d6757e-cb0f-444c-9b6b-0cbdf561b2af","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.707826Z"},"links":{"cited_paper":"/paper/2305.12839","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:3a987b40aa7038d318d34caded5f643f54d86c98ea5369e65ffdc5ea2cf23505","observation_id":"74b8dca5-c583-4fd1-acbd-7016962c5497","resolution":{"observed_at":"2026-08-05T20:31:50.264086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10303","last_updated":"2024-07-14T19:32:33Z","snapshot_observed_at":"2026-08-16T13:34:20.280215Z","submitted_at":"2024-07-14T19:32:33Z","title":"Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation","version":1},"cited_work":{"arxiv_id":"2407.10303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10303","snapshot_observed_at":"2026-08-05T20:31:49.944924Z","title":"Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation","venue":"eess.AS","work_id":"986f12f8-38e2-463e-a14d-6834de22bea8","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.805565Z"},"links":{"cited_paper":"/paper/2407.10303","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:fc46008668f872a06e2de07a475011190fef17441dee64344428025703761909","observation_id":"08faf3b5-bde3-4fae-a1fe-1c067bc2b645","resolution":{"observed_at":"2026-08-05T20:31:50.050215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.964214Z","title":"Training language models for long-span cross-sentence evaluation,","venue":null,"work_id":"a6dd2c64-8243-4504-beb0-3763c10f9047","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.884033Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:30a15f2f10dc117dd61b80d925d23c96766bd2dd6f2390c83dc175a9935b01ed","observation_id":"6976842c-c120-407c-8157-c58085e3a12f","resolution":{"observed_at":"2026-08-05T20:32:01.036595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11349","last_updated":"2020-10-21T23:40:26Z","snapshot_observed_at":"2026-08-16T19:11:38.218665Z","submitted_at":"2020-10-21T23:40:26Z","title":"LSTM-LM with Long-Term History for First-Pass Decoding in Conversational Speech Recognition","version":1},"cited_work":{"arxiv_id":"2010.11349","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11349","snapshot_observed_at":"2026-08-05T20:31:49.686003Z","title":"LSTM-LM with Long-Term History for First-Pass Decoding in Conversational Speech Recognition","venue":"cs.CL","work_id":"997a796d-649d-4bc5-9343-0bf88dc00493","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.984032Z"},"links":{"cited_paper":"/paper/2010.11349","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8175511346d79dd94c9a86499edb8ee0668f3cdf8b9601025c64eb8d0215c060","observation_id":"d274690e-fcbd-4c06-aefb-1596b24930c2","resolution":{"observed_at":"2026-08-05T20:31:49.827274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.771072Z","title":"Session-level language modeling for conversational speech,","venue":null,"work_id":"1681a762-288a-4eb9-9a7f-3ecd76268915","year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.099735Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:533e76a4d259f812a49d17e2396483684b7ffae14c339ba3f5b090197ab91813","observation_id":"a44c5369-b7b4-4c4f-938f-b250fe31b8f0","resolution":{"observed_at":"2026-08-05T20:32:00.851580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.447451Z","title":"Transformer-xl: attentive language models beyond a fixed-length context,","venue":null,"work_id":"c2e1913c-ac8f-4774-a6b3-b3f028edd8a7","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.175833Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c5c373a60901fcd611938858bdafbedf709923c421daf1f6aa391f066ca478e7","observation_id":"1a018f5b-d065-4fb8-9e11-3bc6c34ad837","resolution":{"observed_at":"2026-08-05T20:32:00.636395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.062920Z","title":"End-to-end speech recognition on conversations,","venue":null,"work_id":"5a3347b3-3d1a-4d9d-a18a-9765942293cf","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.289439Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:48303773ea6fc98cd97be746a3cbb396ff4cb4f071e87e3f3ae8cada29427986","observation_id":"de503af8-0a5f-4b5b-8e64-72b83282e881","resolution":{"observed_at":"2026-08-05T20:32:00.225580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.702981Z","title":"Contextualizing ASR lattice rescoring with hybrid pointer network language model,","venue":null,"work_id":"fec24a10-7a04-4a70-8ceb-d55da33a6770","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.363244Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7c42f75de7dc7c0668c208a057467d2c456782cecf4a0ab226b74b5b7d4b1991","observation_id":"20aad9f9-3f85-4409-9fd3-f433b7213289","resolution":{"observed_at":"2026-08-05T20:31:59.827745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.600997Z","title":"Use of contexts in language model interpolation and adaptation,","venue":null,"work_id":"ca8a1deb-5b0b-4666-a8f7-e95160a5c439","year":2013},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.455433Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ee1e7b3e7f013eba81ce80a6e5b9c775fc947825f9f00917bdaf0089d5a8b80d","observation_id":"893e0851-d763-4751-9ca6-b08b2789e449","resolution":{"observed_at":"2026-08-05T20:31:59.689635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T20:31:42.516968Z","title":"Longformer: the long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.516968Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f157310d2c3d946543eedc149e9de24de951b76fc340eacc1275663a3034dc5a","observation_id":"4a711db4-3544-43ce-89b3-b878233fdb68","resolution":{"observed_at":"2026-08-05T20:31:42.516968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.453609Z","title":"Transformer language models with lstm-based cross- utterance information representation,","venue":null,"work_id":"15aed1f6-5904-41ae-b186-bf2346e9af16","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.603756Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e6b0986cc4876ecee4a4e727d99e86288bce40534eae52194c94d3bc57d6e72d","observation_id":"29dfea9b-e96d-4063-8f0c-75fe30248ea4","resolution":{"observed_at":"2026-08-05T20:31:59.523332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.276839Z","title":"Ctc-assisted llm-based contextual asr,","venue":null,"work_id":"61df261f-042b-4921-af8c-a4cc74798447","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.670064Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:38c8518232681974c35ed1063c430ce4410c8b232d7827c85ce6fffaaa414c3b","observation_id":"9d5d7fc7-5001-4462-9ccb-d1aa6801088e","resolution":{"observed_at":"2026-08-05T20:31:59.365324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-08-16T13:36:42.713695Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-05T20:31:42.749315Z","title":"Seed-asr: Understanding diverse speech and contexts with llm-based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.749315Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:73dfbed03214c60dec16fb8bf5b5723204ee93f7fe609cd5f98af96bd6276aed","observation_id":"49e04d82-0591-4a2b-bcfa-165cee1248a3","resolution":{"observed_at":"2026-08-05T20:31:42.749315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.107172Z","title":"Contextual asr error handling with llms augmentation for goal-oriented conversational ai,","venue":null,"work_id":"d412c0b4-6e42-47eb-8cdd-3ab37c78cb54","year":2025},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.859181Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1e6fd0e14d2bcb6ec560a0215558b9b6aae8f7bdf3c22e90dedbb8c72aa1348c","observation_id":"40e7f0d3-ce42-4085-9876-cddf36846caf","resolution":{"observed_at":"2026-08-05T20:31:59.195690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.945314Z","title":"Towards asr robust spoken language understanding through in-context learning with word confusion networks,","venue":null,"work_id":"aea767de-08d4-4ae1-936a-6296a15859fd","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.920140Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c6b8326d8ffebcc97e334ebdb1a9c379874775b0762dd58d6d81f4b40792b4f4","observation_id":"091432e8-62b9-48a7-86de-4e49e62bfb26","resolution":{"observed_at":"2026-08-05T20:31:59.005515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.816094Z","title":"Contextualization of asr with llm using phonetic retrieval- based augmentation,","venue":null,"work_id":"3e3fa4c8-60ad-4988-943f-27108b220536","year":2025},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.000136Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:2349a5805aeb34babaf53ad8c945b775885a42f9614a571ea1423c797020c35d","observation_id":"14d87e6b-ea9c-43bd-a846-96e9386cd530","resolution":{"observed_at":"2026-08-05T20:31:58.856857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.673008Z","title":"End-to-end speech recognition contextualization with large language models,","venue":null,"work_id":"0da5fb43-6db9-40f8-84fb-906487ca436b","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.104408Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:703b6e8a34da7c2fc9b4633e37a57f488f850ca960fe21878bd973e6f56c1eb7","observation_id":"fd7b20e2-e5d2-4c48-8491-71acd464f171","resolution":{"observed_at":"2026-08-05T20:31:58.746831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.503317Z","title":"Improving domain-specific asr with llm-generated contextual descriptions,","venue":null,"work_id":"9d40e7b6-3e24-474d-b142-4ee721f10d30","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.219288Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e16ede99b19d74e52f942b806996b114cc4ab8279cfb7c2699f3b4c4d7a255d0","observation_id":"91402f0c-236e-4798-b02d-1be9e1a24467","resolution":{"observed_at":"2026-08-05T20:31:58.599667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05839","last_updated":"2024-06-13T07:50:40Z","snapshot_observed_at":"2026-08-16T13:44:45.289400Z","submitted_at":"2024-06-09T16:00:00Z","title":"MaLa-ASR: Multimedia-Assisted LLM-Based ASR","version":2},"cited_work":{"arxiv_id":"2406.05839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05839","snapshot_observed_at":"2026-08-05T20:31:49.402658Z","title":"MaLa-ASR: Multimedia-Assisted LLM-Based ASR","venue":"eess.AS","work_id":"fda83a26-a1ca-47a4-8118-17a5b8d74d02","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.295375Z"},"links":{"cited_paper":"/paper/2406.05839","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:bb81c4e7242c7c980dbba050ecc69bd45fa448da21ec2f589f8ba2d88c972743","observation_id":"e5436655-70a5-4320-af73-a6360e8e52d1","resolution":{"observed_at":"2026-08-05T20:31:49.498400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.317552Z","title":"Contextualized speech recognition: rethinking second- pass rescoring with generative large language models,","venue":null,"work_id":"737a6709-64e6-487e-affb-d8838645730a","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.373827Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:6f48df4eb392014f5dae8b52a3b3a6c8cbcb000b80e1e00e9ae44375c89cd86a","observation_id":"fde25a80-3665-471e-971e-2ca0bdc51efe","resolution":{"observed_at":"2026-08-05T20:31:58.403844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.186759Z","title":"Improving speech recognition with prompt-based contextualized asr and llm-based re-predictor,","venue":null,"work_id":"2bdafeef-b122-4977-a024-2f4615954fb8","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.456893Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5e84a78cbee1dbf212655c26902fcdebd8fec856c25373181cc0662d508a9512","observation_id":"4eecbe69-a9bd-41d0-9f06-79167b1a6412","resolution":{"observed_at":"2026-08-05T20:31:58.237641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11382","last_updated":"2024-06-06T05:39:50Z","snapshot_observed_at":"2026-08-16T14:25:51.695130Z","submitted_at":"2024-01-21T03:15:05Z","title":"Using Large Language Model for End-to-End Chinese ASR and NER","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11382","snapshot_observed_at":"2026-08-05T20:31:43.555162Z","title":"Using large language model for end-to-end chinese asr and ner,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.555162Z"},"links":{"cited_paper":"/paper/2401.11382","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e879fc4263f131db63b75465072e6aa3da8330e8684beb2072b86a57f82fb09b","observation_id":"af0de628-c71a-4cc2-94db-f74b2e7f04d3","resolution":{"observed_at":"2026-08-05T20:31:43.555162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T20:31:43.616971Z","title":"Compressive Transformers for Long-range Sequence Modelling,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.616971Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:b522f92425be6b76742224e2c8c4fde6d1c3ebe116f52bba4ed3f0253b90d75e","observation_id":"cdcaf6aa-a5b6-4586-b7a8-9ab090614695","resolution":{"observed_at":"2026-08-05T20:31:43.616971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.015310Z","title":"Speaker-aware Speech-transformer,","venue":null,"work_id":"82c65679-8d62-49c0-8259-3a2fd665558d","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.710776Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7e3e0a286f867ef7c9a76a0c7195eca512ca9d349f4c33a7cb5c8122894f1039","observation_id":"4d49d666-82cd-4600-a11c-daaf11c69055","resolution":{"observed_at":"2026-08-05T20:31:58.090493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.881707Z","title":"Transformer ASR with Contextual Block Process- ing,","venue":null,"work_id":"c5ce6e45-8525-4424-b42b-3b8473b27bde","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.789641Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:adc4fdb187104f4b46c8e671242efefd62907cd711ff4eb0a27dc3105a4f7f7b","observation_id":"a151e8a4-7ff0-434a-9d7a-4e0a24c7906e","resolution":{"observed_at":"2026-08-05T20:31:57.946512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.750553Z","title":"Transformer-based long-context end-to-end speech recognition","venue":null,"work_id":"c5bdb0d2-dd0c-423e-a3f5-d3bb7dd86b4a","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.856177Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:51bc5df2ac41ce830931593ddb8d1fe3fb87f823682cb0292b66845e511ce446","observation_id":"c9307482-10d9-4ae7-bc12-dbcab7aa9904","resolution":{"observed_at":"2026-08-05T20:31:57.806972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.596791Z","title":"Advanced long-context end-to-end speech recognition using context-expanded transformers,","venue":null,"work_id":"fd30fa84-486c-4d25-a837-89bd67735b32","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.939035Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0345bef02d7c56fbad5afe20417c326831cfadd7b8bd275aba464e6cb03fa8ba","observation_id":"24bdc12b-946d-40df-a2f9-8cf21cc5a672","resolution":{"observed_at":"2026-08-05T20:31:57.684237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.473641Z","title":"Context-aware end-to-end asr using self-attentive embedding and tensor fusion,","venue":null,"work_id":"bdded32b-6df0-4490-86a3-d5ae1c04132b","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.010039Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cd74f4866f2c00c23c085694b3295ad499fabc5dd9701d74cb18bcb0cb14db7c","observation_id":"89b091be-dc99-4f00-a415-0b62fc89a353","resolution":{"observed_at":"2026-08-05T20:31:57.527917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.286208Z","title":"Longfnt: Long-form speech recognition with factorized neural transducer,","venue":null,"work_id":"dff48a50-7728-4486-83a2-7e912fa9c8cf","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.107285Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1ee2b6837ae718a4f247d19a2c3672812c981446123b4ba373beb030c59ad53c","observation_id":"97cf2b87-6708-4372-9ff2-d8c13f6f46ce","resolution":{"observed_at":"2026-08-05T20:31:57.374355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.132168Z","title":"Advanced long-content speech recognition with factorized neural transducer,","venue":null,"work_id":"a902e153-3d4c-4608-a85a-0cb6f75f1d8e","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.172636Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:26b48daf494d4480a3ff257c0c3b97ff747c3c8da37ea0cc8b418e084d978bd9","observation_id":"9bf31ccf-200c-406b-bb7e-aaf0ef13288c","resolution":{"observed_at":"2026-08-05T20:31:57.213167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11604","last_updated":"2019-06-27T13:10:37Z","snapshot_observed_at":"2026-08-17T05:59:17.321000Z","submitted_at":"2019-06-27T13:10:37Z","title":"Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion","version":1},"cited_work":{"arxiv_id":"1906.11604","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.11604","snapshot_observed_at":"2026-08-05T20:31:49.055486Z","title":"Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion","venue":"cs.CL","work_id":"577114c2-209c-4369-89e3-7a43fd1479e6","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.256170Z"},"links":{"cited_paper":"/paper/1906.11604","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:fc5decbf0233d115053e6c95ad2d94ce6e926983d4aaca360cec69ccff84ad05","observation_id":"288a580c-37a1-4974-87da-c5a9a22e0703","resolution":{"observed_at":"2026-08-05T20:31:49.180696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.976083Z","title":"Dialog-context aware end-to-end speech recognition,","venue":null,"work_id":"5e31b82c-a56b-4160-afa6-30c5e0cdf2b4","year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.339765Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ed98c10dd0e8a149e4d5a111761ccf981f8f4a848581bcbd056db5182734eb27","observation_id":"dace3c57-6b23-4716-b1f7-579469cae9fa","resolution":{"observed_at":"2026-08-05T20:31:57.039618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10538","last_updated":"2021-06-15T15:49:49Z","snapshot_observed_at":"2026-08-16T19:04:22.714684Z","submitted_at":"2020-11-20T18:16:04Z","title":"Improving RNN-T ASR Accuracy Using Context Audio","version":3},"cited_work":{"arxiv_id":"2011.10538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.10538","snapshot_observed_at":"2026-08-05T20:31:48.705165Z","title":"Improving RNN-T ASR Accuracy Using Context Audio","venue":"eess.AS","work_id":"bdc75459-87fe-40cf-8d0b-abbbe52d9203","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.437262Z"},"links":{"cited_paper":"/paper/2011.10538","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f9078a5e7f202bd3a1909e35288125a24339e517e875498d404ad86315a2b516","observation_id":"500088fc-abbc-4dc7-970a-27a59f22f618","resolution":{"observed_at":"2026-08-05T20:31:48.854090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.835490Z","title":"Large-context automatic speech recognition based on rnn transducer,","venue":null,"work_id":"7a4a5d4c-e94c-49f0-b5af-686d6d0fa75b","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.553967Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:91cc2ddf695b3f0378c672f309180692ba84533b28281220863b225e868900ad","observation_id":"58ce565f-11bf-4f36-af09-e80c3f164fc3","resolution":{"observed_at":"2026-08-05T20:31:56.894247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.680280Z","title":"Phoneme-aware encoding for prefix-tree-based contextual asr,","venue":null,"work_id":"c5adf6b5-3ab8-403e-be75-a6c32f865416","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.635612Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0f6ba62755e303f9be68a545a86314fbe7cb32721f33f666bc77ad94483a7605","observation_id":"15b7a962-8d94-426f-92b8-22bd2eff6411","resolution":{"observed_at":"2026-08-05T20:31:56.762269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10180","last_updated":"2024-04-23T13:43:26Z","snapshot_observed_at":"2026-08-16T14:00:40.121612Z","submitted_at":"2024-04-15T23:28:13Z","title":"Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR","version":2},"cited_work":{"arxiv_id":"2404.10180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.10180","snapshot_observed_at":"2026-08-05T20:31:48.395519Z","title":"Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR","venue":"cs.CL","work_id":"0556daa6-9005-442f-abc4-7382760622b2","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.729117Z"},"links":{"cited_paper":"/paper/2404.10180","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:310a79bfdec5d24743fea00a49f3d500f9dc046a704179afb1be8a29a1bafb21","observation_id":"35ac3e39-c498-464b-8d23-00baa8686d08","resolution":{"observed_at":"2026-08-05T20:31:48.551140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.553702Z","title":"Contextualized end-to-end speech recognition with contextual phrase prediction network,","venue":null,"work_id":"49c28724-571c-4772-8800-53991c74fdc0","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.809319Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:73d6e1691e4da68918e84c9f76881e6bbd059ba88b7d838d96370c24691c3a0c","observation_id":"93f9e98f-fa5e-4f4c-a78a-0cc1a17b62a3","resolution":{"observed_at":"2026-08-05T20:31:56.611543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.398074Z","title":"Semi-autoregressive streaming asr with label context,","venue":null,"work_id":"1e84bc5d-d97f-4d24-9ef4-2daf472438a5","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.893812Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:2152f248bca9bea1869090b57dbb0dbcbe88f658e06cc34ceba0295636420097","observation_id":"90f4525e-4987-4c89-9d6d-2f4f2e527839","resolution":{"observed_at":"2026-08-05T20:31:56.459164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.263063Z","title":"Context-aware transformer transducer for speech recognition,","venue":null,"work_id":"cf73c02a-2dac-4957-a389-bb4eb025610d","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.983848Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ab1b0e14e1c11f2da47740162057ca53864b8c098ea560b7ea08e92dbaa4b931","observation_id":"8e0f3d92-8326-49b5-b0de-56fd29b0fb72","resolution":{"observed_at":"2026-08-05T20:31:56.309374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.129861Z","title":"Towards effective and compact contextual representation for conformer transducer speech recognition systems,","venue":null,"work_id":"c3efe5b0-7b9a-4e82-96bd-b919f33a5180","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.047116Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f7856bb589312f97b64f7301ee67b0b2553c9dc5b5b3c895cc5fca0d2571f8bc","observation_id":"10454637-34e0-4bc5-a807-76b2982a8845","resolution":{"observed_at":"2026-08-05T20:31:56.180065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.972105Z","title":"Wav2vec 2.0: a framework for self-supervised learning of speech representations,","venue":null,"work_id":"8d90b876-ee9c-4ebb-9dbf-150ffaf15efb","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.119425Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e65d186f045ae8f144ca06090e2532b16a19a32f078851737b10dd8bdda96193","observation_id":"3c8d4152-b711-4728-aacd-1b96368900e8","resolution":{"observed_at":"2026-08-05T20:31:56.044753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.837081Z","title":"Wavlm: large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"092e822b-8743-44a3-bb34-1822ff610ae5","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.187611Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e0fd8d87d6dceb9f6c54b00b24948a213fa5b4f822fbb2c5060c7d8965550ee0","observation_id":"5701ae8b-ddff-49f9-80a5-e7d78d2fd852","resolution":{"observed_at":"2026-08-05T20:31:55.898704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.633463Z","title":"Hubert: Self-supervised speech representation learn- ing by masked prediction of hidden units,","venue":null,"work_id":"9faa19b2-e64c-4d15-8470-3b35c8ffa15e","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.269084Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cfd7d5645f6ba2194b49a2d5dcbb0ede734a4b6fe47caecdad849419ffe3425e","observation_id":"3816819a-e1c4-41b2-91fc-8eda76b5cfc6","resolution":{"observed_at":"2026-08-05T20:31:55.727367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.462778Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":"2257f352-3761-4469-9bc9-8141729abb3c","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.364942Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7940f74393816b13ddb96e76b74f47b3e3091d6f134312cbb2234b814f1b8865","observation_id":"d25de274-8d78-40ef-8a6c-2c55cd28f302","resolution":{"observed_at":"2026-08-05T20:31:55.559832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.308105Z","title":"XLS-R: Self-supervised Cross-lingual Speech Repre- sentation Learning at Scale,","venue":null,"work_id":"9357c9bb-9fbc-4348-b5ff-3b6594cd20ab","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.431578Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:aeed72f4c532bbd6df18fdb9edff0d751b457866e610a8c5a77f4b8af9c47aeb","observation_id":"1b8b7bd8-9bc8-49d5-8bcf-a14c1f119d77","resolution":{"observed_at":"2026-08-05T20:31:55.366817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.130820Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"ce855120-6839-4242-86cc-ef873ba0e7ef","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.508204Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:414040a70d9b704ac141bfcb3aef1494b255ed290a5c46de32eccaf24e3a07d3","observation_id":"6d1bce3b-7bed-4b95-a086-62e88057544f","resolution":{"observed_at":"2026-08-05T20:31:55.203752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.941333Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"9a377e82-567b-454f-9603-7bc84ffb9142","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.576141Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f1e691da7ffaf2b32567e619bf6ff13f0cde500e93e22e93fcbab1df7795858e","observation_id":"2f732a3c-5b53-4682-ad90-78c29eb96669","resolution":{"observed_at":"2026-08-05T20:31:55.018209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-17T03:00:45.737117Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-08-05T20:31:45.668112Z","title":"Fairseq: A fast, extensible toolkit for sequence model- ing,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.668112Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:963c46f996485a744fba89b329de10cbbbf8c2b5510f1ad5fbc268bd12d6b211","observation_id":"d1bf3b75-9894-4e2f-9d00-f8bb23dc60eb","resolution":{"observed_at":"2026-08-05T20:31:45.668112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-08-16T14:51:23.573469Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-05T20:31:45.751156Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.751156Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d2620d55a928b8c20b47eeb141de12523f1bdc56e724914d51514f12a4326d78","observation_id":"e171fbec-8b85-4df6-ac32-35cbfffa24d1","resolution":{"observed_at":"2026-08-05T20:31:45.751156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.783421Z","title":"ESPnet: End-to-End Speech Processing Toolkit,","venue":null,"work_id":"95cb58eb-722c-4675-92dd-32d0c5000b97","year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.863510Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:dfd95bf2bb7d48712af0af49c6af202d30d02ac20e6db2f2d11fd1259e323dd5","observation_id":"d7e200e4-be8f-4994-bed1-132c5b6756fa","resolution":{"observed_at":"2026-08-05T20:31:54.878240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T20:31:45.946423Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10k hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.946423Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:55bbe9a8efe236283932f6ebc8e27aad75ac8efd66403f910b7ad08c7f606b17","observation_id":"0a05ab93-c5b3-4b3c-9891-049835cbe534","resolution":{"observed_at":"2026-08-05T20:31:45.946423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.610031Z","title":"Wenetspeech: A 10000+ hours multi-domain man- darin corpus for speech recognition,","venue":null,"work_id":"5fa45e45-05ad-4c38-8f69-1c16286a0249","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.004011Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:fbf8ebc23dbb1ae1a146f30d4b126b48c440860980fee596168a85513e73f516","observation_id":"bf08cde8-13d4-4769-93f2-da483918513b","resolution":{"observed_at":"2026-08-05T20:31:54.678706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.433640Z","title":"The natural history of alzheimer’s disease: description of study cohort and accuracy of diagnosis,","venue":null,"work_id":"e084fb15-e77e-4286-ba4b-325191f1502c","year":1994},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.098424Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8cce1293a2fbea016791b52e046831f8d5263f67f6dc27f6b887bd6d3127f902","observation_id":"41321727-56bf-411a-a94d-3d2ea0de4481","resolution":{"observed_at":"2026-08-05T20:31:54.500000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.258302Z","title":"Speaker turn aware similarity scoring for diarization of speech-based cognitive assessments,","venue":null,"work_id":"4b0eba98-6692-4300-863d-7c49a87cf334","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.188228Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:948fab8bb86e0182e466c129e4fd3f8815ff37c781b779c4f34bd944856f09b3","observation_id":"877244d9-6847-4c06-97dc-e304f44a1a21","resolution":{"observed_at":"2026-08-05T20:31:54.337853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.075394Z","title":"Self-supervised asr models and features for dysarthric and elderly speech recognition,","venue":null,"work_id":"a93264dd-1578-4a42-b008-8c07af2e0b2b","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.265388Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:028624517819715a5fd46510a453c820bed044d2df22e62fd27bb36a9798f1a2","observation_id":"f96dc9c6-d6f3-4266-81f9-4c88cbab1a89","resolution":{"observed_at":"2026-08-05T20:31:54.172237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.918028Z","title":"Developing real-time streaming transformer transducer for speech recognition on large-scale dataset,","venue":null,"work_id":"36f07f04-5841-4899-ace4-ec7892c0218c","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.350732Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1f3dbed8132d8e4142c72ef2947b9696aca87008fc2a0c1b60f771104bc09aec","observation_id":"fffb07a8-d62b-4a14-b776-a01fae785d9e","resolution":{"observed_at":"2026-08-05T20:31:53.979937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.709182Z","title":"Transformer transducer: a streamable speech recog- nition model with transformer encoders and RNN-T loss,","venue":null,"work_id":"a5e15dd3-6c88-458b-9902-ef0645a3949b","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.434543Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:22a8d3968293fabc22a65ded598c5e9f07f4b2926a88e84a9ed6ecc7ed224204","observation_id":"6a90f7b1-9a5d-412f-bc2f-ffe669f11b70","resolution":{"observed_at":"2026-08-05T20:31:53.827935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12977","last_updated":"2019-10-28T21:29:21Z","snapshot_observed_at":"2026-08-14T16:06:14.688157Z","submitted_at":"2019-10-28T21:29:21Z","title":"Transformer-Transducer: End-to-End Speech Recognition with Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12977","snapshot_observed_at":"2026-08-05T20:31:46.546745Z","title":"Transformer-transducer: end-to-end speech recogni- tion with self-attention,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.546745Z"},"links":{"cited_paper":"/paper/1910.12977","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:3e379993e7241c54d9ffccbb068f3c995846685a103e8a06d7d6bf775013f416","observation_id":"9a4deac2-3a99-4335-b266-c56ae1695911","resolution":{"observed_at":"2026-08-05T20:31:46.546745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.511195Z","title":"Language modeling with gated convolutional networks,","venue":null,"work_id":"c8f1542f-9fa7-4b0e-a340-5d77efd50c3b","year":2017},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.629844Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c307e6e33c6b98667e4854b8bc2b46cca590f7c368ed01a20b923ae9472cc123","observation_id":"9cd3241e-12b5-4540-9b0d-224aa63924af","resolution":{"observed_at":"2026-08-05T20:31:53.598121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.03609","last_updated":"2016-02-11T03:06:33Z","snapshot_observed_at":"2026-08-14T22:10:48.035016Z","submitted_at":"2016-02-11T03:06:33Z","title":"Attentive Pooling Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.03609","snapshot_observed_at":"2026-08-05T20:31:46.700394Z","title":"Attentive pooling networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.700394Z"},"links":{"cited_paper":"/paper/1602.03609","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cef4a512ebe7d2666aa507ea4c397e02596d10704ebe528e67dec68c217d4d96","observation_id":"ead4386f-fbc7-462c-87c3-4eb7b118fbc1","resolution":{"observed_at":"2026-08-05T20:31:46.700394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.357430Z","title":"Alzheimer’s Dementia Recognition Through Sponta- neous Speech: The ADReSS Challenge,","venue":null,"work_id":"20cc707f-675f-4ad5-9fe6-02b9b8281340","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.810510Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a304fa9ea9e7a519d8f12ef28e6678d74b6754cce76104b0ddddca6a531e764a","observation_id":"0ae1fd88-4d05-4373-bcbd-1ce6a34afdb4","resolution":{"observed_at":"2026-08-05T20:31:53.437465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.233913Z","title":"Development of the cuhk elderly speech recognition system for neurocognitive disorder detection using the dementiabank corpus,","venue":null,"work_id":"1844c2e2-2da4-4d35-89fb-05d10f67872b","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.871585Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5c974b2566cd3cd666899b73c2d19969fe8c1c50b96a0ba00171be24e6be1508","observation_id":"bf71d3d1-869a-41fa-8a5f-4ea6c3ede40d","resolution":{"observed_at":"2026-08-05T20:31:53.276825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.041400Z","title":"Speaker Turn Aware Similarity Scoring for Diarization of Speech-Based Cognitive Assessments,","venue":null,"work_id":"facee184-f1a6-46d7-99cb-fa3f72d784fa","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.037997Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:bc3549922347da41ecf853f5cb95a32bd0b4ec0d3f134356f0d6430460fd5d9e","observation_id":"0d376c8b-bcb5-424a-b8d6-1e2a86371335","resolution":{"observed_at":"2026-08-05T20:31:53.119919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.876542Z","title":"Speaker adaptation using spectro-temporal deep features for dysarthric and elderly speech recognition,","venue":null,"work_id":"b7b49d44-5e10-4a7c-aa55-9f208af05f90","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.136299Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a5a04a7f58a477deb938b6166bd01152e11c78d4436fa2e0fd25ecb9c98a241a","observation_id":"d2f7a809-7897-40ff-8f05-8ffa777f06f6","resolution":{"observed_at":"2026-08-05T20:31:52.961044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.718936Z","title":"Some statistical issues in the comparison of speech recognition algorithms,","venue":null,"work_id":"432927d6-133d-439e-b894-371620298ac7","year":1989},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.141110Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:94ca925b31fe3603cca3084b6203ca524fd400f13b13d3e8610052563d7c6b4c","observation_id":"6b58fa7c-73a7-4d23-bdf8-1f82f5f72748","resolution":{"observed_at":"2026-08-05T20:31:52.783057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.539318Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition,","venue":null,"work_id":"fc589bb1-eb0c-45dd-aa13-90e75544a0b0","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.221732Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cf8ef46c3b8ed4bfee48237ed56f8d3878d0ba74071d9b78a123978abbf975af","observation_id":"b9a8482f-8ffd-4bea-ac15-1162bb3c1154","resolution":{"observed_at":"2026-08-05T20:31:52.623835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.315259Z","title":"Tools for the analysis of benchmark speech recognition tests,","venue":null,"work_id":"1702cca7-03cb-43fa-baf7-f1bcd48075c1","year":1990},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.380300Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8d5a87311e9e7449a6d79547d87e2079a8b9dc20596a6859357d4dc4513caae6","observation_id":"4c969da5-5255-4ec0-93e0-c7c517cc5419","resolution":{"observed_at":"2026-08-05T20:31:52.403485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.113223Z","title":"Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging Features For Elderly And Dysarthric Speech Recog- nition,","venue":null,"work_id":"38318c9c-f7b5-48fe-997a-d673668fd2b3","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.521344Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:641315748a70331a7eee604f01b849931369a4279df40786039545d3c6f9ef43","observation_id":"44c0c64e-9953-4c8c-8a7e-eb64a6067c21","resolution":{"observed_at":"2026-08-05T20:31:52.219031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.946286Z","title":"Homogeneous speaker features for on-the-fly dysarthric and elderly speaker adaptation and speech recognition,","venue":null,"work_id":"d6772896-2229-4dea-ad31-117cec6c0028","year":2025},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.653179Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a5fc96a6382cc5fd902089cd073c4c419d831dc918a245029cc2ee04d3891bc5","observation_id":"ff45c5f5-5b0f-4e81-8a1a-ce0dfad35a06","resolution":{"observed_at":"2026-08-05T20:31:52.029574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.738202Z","title":"Bayesian Parametric and Architectural Domain Adap- tation of LF-MMI Trained TDNNs for Elderly and Dysarthric Speech Recognition,","venue":null,"work_id":"a8d2d3c0-5574-4f17-9187-3d83efee6934","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.808713Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:88278de0b8636c4a801e2d5c9523b5e4f8d721a09bd302b3bf5b218dd7deab61","observation_id":"bc9f7db8-6cba-4681-9c3c-de2bb60715e9","resolution":{"observed_at":"2026-08-05T20:31:51.813760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.527462Z","title":"Conformer Based Elderly Speech Recognition System for Alzheimer’s Disease Detection,","venue":null,"work_id":"20216d8a-509f-454c-a942-0a312e5eba46","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:48.005043Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1172f4b53cf512b41b4a8a6db00026283426a5928acb4785ee9ded880f9067c4","observation_id":"65f23f34-7a71-4544-b5e4-7a1fe7f6ee55","resolution":{"observed_at":"2026-08-05T20:31:51.616251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.342477Z","title":"Hyper-parameter Adaptation of Conformer ASR Sys- tems for Elderly and Dysarthric Speech Recognition,","venue":null,"work_id":"4b06a506-7787-4012-a757-5c0ed90aa4b3","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:48.143276Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8f3b98fa55969fe2367d4f03da03bcc9a02ace889e5da4dab416689dd384f078","observation_id":"fc64bde5-cc7b-458a-adf0-b7ea595b99f4","resolution":{"observed_at":"2026-08-05T20:31:51.418413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T19:52:30.794115Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":11,"verified_fuzzy":57},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 0 inbound Pith citation observations for arXiv:2508.10456."}