{"as_of":"2026-08-18T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a14d874864032c4784f657c81851adcc19da0227f6e1f11bb04c09ce8df8eb8","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:46:55.858564Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00804/citation-record","integrity":"/paper/2501.00804/integrity","json":"/paper/2501.00804/citation-record.json","paper":"/paper/2501.00804"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.376327Z","title":"Measuring the gap between hmm- based asr and tts,","venue":null,"work_id":"5667f155-b9cf-4ba2-ab30-8b7abc9d417f","year":2010},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.746213Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:d38cd38383fb1a6fa7251c436b08f273cf1eeda53e4952e1a31080fae6f19e83","observation_id":"d05860e3-fca5-4340-84e6-e624c30d8e6e","resolution":{"observed_at":"2026-08-10T22:46:56.380637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.361726Z","title":"Thousands of voices for hmm-based speech synthesis–analysis and ap- plication of tts systems built on various asr corpora,","venue":null,"work_id":"3f3d468a-e9e6-41e9-8fa9-f84628331219","year":2010},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.751918Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:13f20ee936605f5084b9e18b672c522bef19553d9ba640506415b3724e6b0705","observation_id":"ac970860-af7e-463f-b983-0cf04a502abe","resolution":{"observed_at":"2026-08-10T22:46:56.366002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.343482Z","title":"Keyword search using attention-based end-to-end asr and frame-synchronous phoneme alignments,","venue":null,"work_id":"8f34bb13-6070-48cd-aa60-0a7751719e61","year":2021},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.756836Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:40007991590b8e8a71ec306d2a0725a93450dac2e069ebd8f565a150f417c32b","observation_id":"a6c31eaf-caa3-47da-8d4f-74a83527fedf","resolution":{"observed_at":"2026-08-10T22:46:56.350163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.323149Z","title":"Modular end-to-end automatic speech recognition framework for acoustic-to- word model,","venue":null,"work_id":"b9554518-e5df-45f6-8d89-09e95670061f","year":2020},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.761498Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:7f048e438d8652b7f6eb289743f89560dbf6653b801ba5298df20de85848dccc","observation_id":"62611774-c5c6-43ff-b63c-8172f06fc285","resolution":{"observed_at":"2026-08-10T22:46:56.328126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.307023Z","title":"Pronunciation dictionary development in resource-scarce environments,","venue":null,"work_id":"353a238e-f3de-4681-9035-0a0d042f0d82","year":2009},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.766058Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:69da1301d2b13e855296af491958fdaed56b1d27671dcf4e0ed582f5cd95a041","observation_id":"f2ee3592-07f0-48c6-9fad-a68efffd6399","resolution":{"observed_at":"2026-08-10T22:46:56.312092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.292946Z","title":"On designing pronunciation lexicons for large vocabulary continuous speech recognition,","venue":null,"work_id":"b5ea7d5e-2e6b-4ba9-a2fd-7b355ec45128","year":1996},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.771046Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:8918044cfb769b89c0647cfc88651a66888206ddcabc7307a151be01385959d7","observation_id":"10e0c178-082d-4b91-b9c7-2585b966bd5a","resolution":{"observed_at":"2026-08-10T22:46:56.297535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.278514Z","title":"Recent advances in end-to-end automatic speech recognition,","venue":null,"work_id":"d191de0c-74fe-479d-8fd3-709ae85d5533","year":2021},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.776097Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:3797958c7c39fc10ba2fb1c431fd733208906b1af6badaf4222df28d0708b646","observation_id":"01986c56-35c9-4501-a970-23a71b199519","resolution":{"observed_at":"2026-08-10T22:46:56.283440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.265644Z","title":"Eteh: Unified attention-based end-to-end asr and kws architecture,","venue":null,"work_id":"ad180d7c-4080-4215-a9bd-b2260b7b7274","year":2022},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.779627Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:48207b52b2385c2504b326672155b047f66e512d81b3287dc60501a04fcc0bd8","observation_id":"f1be1297-30c6-488f-990c-94e964adc5bf","resolution":{"observed_at":"2026-08-10T22:46:56.269889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:55.783357Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.783357Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:1f4769e630613518de0eb9328da3e5bedd2ebc3e23efd872891d53a2e7301810","observation_id":"8fa4cb7a-b1cf-4f26-9e70-381b4f6b34ae","resolution":{"observed_at":"2026-08-10T22:46:55.783357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.238306Z","title":"Online hybrid ctc/attention end-to-end automatic speech recognition architecture,","venue":null,"work_id":"cbb24fe3-bb9e-463f-a5e1-e1e583963749","year":2020},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.786896Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:6b11288bb89c245c203f9ad9463e5c390c760062fed86968156571c28b784a56","observation_id":"80fd3cb9-d4f7-4808-91a3-468301ed162d","resolution":{"observed_at":"2026-08-10T22:46:56.242301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.218210Z","title":"Phoebe: Pronunciation-aware contextualization for end-to-end speech recogni- tion,","venue":null,"work_id":"1e293918-3fd7-46f6-9e96-3dcca1adb9ea","year":2019},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.790159Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:68babc0c124dd1f2682597d1b118b59715fed83d7592c1dc1715049f86bc875c","observation_id":"f71ac8cf-abd5-4c26-9ba5-861e36a3cf7b","resolution":{"observed_at":"2026-08-10T22:46:56.226692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:55.794288Z","title":"Towards contextual spelling correction for customization of end-to-end speech recognition systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.794288Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:75db7cf6e66817ef68d474dfbe97aa5f6f0c81cff682203863a0bfdd74902f77","observation_id":"a9dc989c-1cf2-4e4f-9feb-3cc531415a2d","resolution":{"observed_at":"2026-08-10T22:46:55.794288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.196738Z","title":"An e2e-asr-based iteratively- trained timestamp estimator,","venue":null,"work_id":"156b8c99-b51f-4844-8e82-9e5044dfcde8","year":2022},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.797711Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:d1b0ddf20411cb7fd7fff6a775c53dfbb6b84f3e1a5af27014d10ac87dad5c8e","observation_id":"d2c0a44b-f9bd-45f4-a1fc-f77a917d9ef4","resolution":{"observed_at":"2026-08-10T22:46:56.202330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:55.801635Z","title":"Connection- ist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.801635Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:4e28ca65d3049096c006e1ebe93483497664e8d08f706d652b1d509f160fb2ec","observation_id":"00e555f3-c184-4f03-958a-a4f09f263746","resolution":{"observed_at":"2026-08-10T22:46:55.801635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:55.805431Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.805431Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:790cf27ff5cf8aedeb0135441b283510aeb2bc92ae902b8b144a7e033a9931b4","observation_id":"b3cd9aff-8ff2-496a-a1e6-37b52feee5c2","resolution":{"observed_at":"2026-08-10T22:46:55.805431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:55.809308Z","title":"Dynamic time warping,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.809308Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:465dcd588802a01ec0c224b25dbd81f40cd57831290b8f14c4ad33b3cd01013b","observation_id":"79c3ec5c-b6ed-456b-a654-e18a4c200f40","resolution":{"observed_at":"2026-08-10T22:46:55.809308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.135363Z","title":"Speech recog- nition and keyword spotting for low-resource languages: Babel project research at cued,","venue":null,"work_id":"c2444625-0b57-4fe3-b60a-b812413ff4ea","year":2014},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.813842Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:fb756f9fb4230d10508ddfacaf11bb7314cc3b2be0fdc2d50b411caaa967433d","observation_id":"fdc5a327-e6d7-4d75-b69f-db3f5ac70317","resolution":{"observed_at":"2026-08-10T22:46:56.143447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-14T18:34:46.662561Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-10T22:46:55.818459Z","title":"Aishell-2: Transforming mandarin asr research into industrial scale,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.818459Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:fc00a832fb044935073a989d1ad26b04697e1a6153c577a092452ae8a39391af","observation_id":"221efc44-ad01-411b-800d-2e43a9a72e1a","resolution":{"observed_at":"2026-08-10T22:46:55.818459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.114035Z","title":"Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"905ddb4a-8d70-41af-b8da-ddb4562144aa","year":2017},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.823052Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:2e95fb5a1c07ec8a45253202c8feddeed07f461f6b9e8516b21f187738328081","observation_id":"65ba2b6c-bd15-469e-a1cf-8671e25cd630","resolution":{"observed_at":"2026-08-10T22:46:56.121623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.098727Z","title":"Contextualized end-to-end speech recognition with contextual phrase prediction network,","venue":null,"work_id":"fc1deb97-8ce2-41b8-b703-39d3762bcda5","year":2023},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.827084Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:f3fb5a2428e65722198ba9f59a09022fa4a0d0665acfb1810d7843cc5f2e65bf","observation_id":"657cd61b-329b-467d-9bb5-94179eac6a80","resolution":{"observed_at":"2026-08-10T22:46:56.104253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.080846Z","title":"Un- supervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"c536bf09-adeb-4323-8b15-6a104af4ef7f","year":2021},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.832232Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:57108b4de773c61f6a9fe4e893349fe53169f8c62365c2e26f277a02be572d05","observation_id":"2afbd069-0674-490b-987b-cf22b1c340ed","resolution":{"observed_at":"2026-08-10T22:46:56.086779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.059047Z","title":"Wenet 2.0: More productive end-to-end speech recognition toolkit,","venue":null,"work_id":"0b0fe505-a48c-4174-9a7b-04b5c2273f88","year":2022},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.838755Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:45ac4e55fa2fedd2124beda8b07ad64c07599fd78d74848eeb90345efe09bfda","observation_id":"c6f33e5f-9982-469a-a616-5b4e44efc260","resolution":{"observed_at":"2026-08-10T22:46:56.066296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.045586Z","title":"Shallow-fusion end-to-end contextual biasing","venue":null,"work_id":"b57d115b-118e-4fd9-aebe-09567e6af8d9","year":2019},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.842693Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:f8af2f0132209ae446cee7a3d7c4535754e55efa6d7d39f0d4df7784ecc1d7cd","observation_id":"df8e4df7-e818-4c57-bd71-8b30a34c9e4a","resolution":{"observed_at":"2026-08-10T22:46:56.050421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.032025Z","title":"Improved neural language model fusion for stream- ing recurrent neural network transducer,","venue":null,"work_id":"8c957a83-4358-43aa-91e6-3de4cbbdbc17","year":2021},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.847588Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:a7ecc51f1c4a7492d019ebe16688a61adb4dd254e939bef1743755d12f4149eb","observation_id":"80b7ad20-5703-42a1-9095-e8546802d07c","resolution":{"observed_at":"2026-08-10T22:46:56.036373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:56.016297Z","title":"Cif-based collaborative decoding for end-to-end contextual speech recognition,","venue":null,"work_id":"18b08f5a-a6c0-4580-a56a-a1d56b53d5ab","year":2021},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.853686Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:14f0ceccd11c236fc28e95f1e2896acf96eea87a560eb5667de5fc0a5937adad","observation_id":"f75e5380-36b6-4bcc-bb1d-772ac57b452d","resolution":{"observed_at":"2026-08-10T22:46:56.021588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:46:55.995453Z","title":"Joint grapheme and phoneme embeddings for contextual end-to-end asr","venue":null,"work_id":"6a02dd1a-b02b-439f-b39f-4c2c568430e2","year":2019},"citing_paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:46:55.858564Z"},"links":{"citing_paper":"/paper/2501.00804"},"observation_digest":"sha256:09340235b89928a7b6c2e0fd733f386807d462a664d4d0437206c7ec115d1289","observation_id":"867ed599-f1f4-42f2-ab1e-b07ceeeaa315","resolution":{"observed_at":"2026-08-10T22:46:56.004531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00804","last_updated":"2025-01-01T11:10:46Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T13:09:42.958346Z","submitted_at":"2025-01-01T11:10:46Z","title":"Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2501.00804."}