{"as_of":"2026-08-17T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:779e18a5acda7035ba901657651f93dc5ba20e87362482caf5c49b7dd0174e7d","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:13:11.939403Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17537/citation-record","integrity":"/paper/2411.17537/integrity","json":"/paper/2411.17537/citation-record.json","paper":"/paper/2411.17537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.378382Z","title":"Improving proper noun recog- nition in end-to-end asr by customization of the mwer loss criterion,","venue":null,"work_id":"ee31987c-4c7c-44a7-b262-adbf5aa9f8fa","year":2020},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.816274Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:e4b27af0e0096814d1630681f28c07ece0e3c6b7e5e5b592cea3430110ac3956","observation_id":"d1fb53bf-ccba-4b84-8587-837ac432bed3","resolution":{"observed_at":"2026-08-12T12:13:12.383662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.361662Z","title":"Personalization of end-to-end speech recognition on mobile devices for named entities,","venue":null,"work_id":"f1bba8cc-5cce-45e6-9abe-22044b8e64aa","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.821661Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:f6bb43b3bb3e2b3bca5e256ad51894e6f7da32b2e545c11ea1fcb2b4841e72e8","observation_id":"171e2db0-00b3-48bc-b65f-c505cbef4ef0","resolution":{"observed_at":"2026-08-12T12:13:12.367127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-16T15:51:28.593814Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-12T12:13:11.826465Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.826465Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:a993caac69d2c764348d66022cbf6fddc453fce0abd67caf3566f99f1d47e7ca","observation_id":"b12b8d2b-9278-414c-878c-72d4e96a80d5","resolution":{"observed_at":"2026-08-12T12:13:11.826465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13516","last_updated":"2023-05-22T22:09:41Z","snapshot_observed_at":"2026-08-16T15:30:53.659514Z","submitted_at":"2023-05-22T22:09:41Z","title":"Scaling Speech Technology to 1,000+ Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13516","snapshot_observed_at":"2026-08-12T12:13:11.831434Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.831434Z"},"links":{"cited_paper":"/paper/2305.13516","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:af079a53ce4859ba849bab744704f5ebbde7068dec65afdfe4050d59cfa44cc2","observation_id":"a600b9bd-bfdb-40d5-8f86-e50a9f9d4cc9","resolution":{"observed_at":"2026-08-12T12:13:11.831434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.345726Z","title":"A better and faster end-to- end model for streaming asr,","venue":null,"work_id":"1212270a-576a-42bb-a42b-53021dff3dc8","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.836718Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:8d2f3ccca74642de1b5f3558475b175063af8b45b90b76a4f0c5d619a2e33d86","observation_id":"7cad08d1-e2ab-45dd-aa9a-37f66686eb3a","resolution":{"observed_at":"2026-08-12T12:13:12.350590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.330709Z","title":"Cascaded encoders for unifying streaming and non-streaming asr,","venue":null,"work_id":"6178772f-f971-40fb-b829-372c2480d703","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.841431Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:cbc6982b52011df3f8b0e9dc2b1c996ff4f21d581ea996347e5a638c6c21741a","observation_id":"8d1623b1-1960-4911-9663-a6a033a65439","resolution":{"observed_at":"2026-08-12T12:13:12.335630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.315496Z","title":"Dual-mode asr: Unify and improve streaming asr with full-context modeling,","venue":null,"work_id":"b39a59f8-7fe8-44fd-b16a-a0d6248ad503","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.846582Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:269c48c2cec62b87d0ca7d192ca0c468798b4e422b4e2407f16f153f6282ef11","observation_id":"6f2010c9-a873-4e92-b3ba-2c06ffbcbeff","resolution":{"observed_at":"2026-08-12T12:13:12.320471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:11.851129Z","title":"Deep neural networks for acoustic modeling in speech recognition: The shared views of four research groups,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.851129Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:aaf639943c8f415131ff96c7a5862461a774de8c5863dc368deafb67f608bbb9","observation_id":"5a344ed2-2b68-45de-9f4d-a90fc9b05648","resolution":{"observed_at":"2026-08-12T12:13:11.851129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.289985Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recur- rent neural networks,","venue":null,"work_id":"a43a14f4-5b6d-4411-971c-7a167eb99476","year":2006},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.855609Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:3e67425cd4b80fd9fb984216c75ee9989cb3724b8e7db6f65916ec7c56864912","observation_id":"b46cab54-a763-478d-a4e9-e98026def95a","resolution":{"observed_at":"2026-08-12T12:13:12.294940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.273759Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"6cf8a2fc-b56e-4719-bffd-1f76eee87e94","year":2012},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.860027Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:0c592267605a8440d1caab7fe944060dd62ba5557fc2a13acd6b0526b6daec56","observation_id":"d4108838-eac7-4adb-9417-b30939bcd4d3","resolution":{"observed_at":"2026-08-12T12:13:12.279887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.259025Z","title":"End-to-end attention-based large vocabulary speech recognition,","venue":null,"work_id":"581d1a66-8f78-4087-8e12-a19a51f8d333","year":2016},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.864442Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:498458080b3b01cdb070b176dae98eb793bfc2280a7caf7eaeba1d0dba9dbd52","observation_id":"0b875d82-d58c-4c7a-9d4b-53ce49212ab7","resolution":{"observed_at":"2026-08-12T12:13:12.263759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.244477Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":"38cb6430-8560-4fc8-a5a1-a84794d79a61","year":2016},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.870010Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:48c540cc91c9690bbec20c4492cdb492d474b1e858ea3a2e624e48366a432d25","observation_id":"3e4a5c99-a609-41d8-b611-ac70dfbab78f","resolution":{"observed_at":"2026-08-12T12:13:12.249338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11235","last_updated":"2020-02-12T11:13:58Z","snapshot_observed_at":"2026-08-16T00:51:47.441561Z","submitted_at":"2019-05-27T14:00:45Z","title":"CIF: Continuous Integrate-and-Fire for End-to-End Speech Recognition","version":4},"cited_work":{"arxiv_id":"1905.11235","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.11235","snapshot_observed_at":"2026-08-12T12:13:12.009517Z","title":"CIF: Continuous Integrate-and-Fire for End-to-End Speech Recognition","venue":"cs.CL","work_id":"6db310f3-536a-456e-8be9-d2cea6143ad4","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.875107Z"},"links":{"cited_paper":"/paper/1905.11235","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:4b28fa385ade8e7535b094b50c06b322f8955316d0803aa9e87dc33180b5ef8f","observation_id":"4d9306e7-1ed0-4a94-89ec-db00dc4286a2","resolution":{"observed_at":"2026-08-12T12:13:12.016770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.229408Z","title":"Crf-based single-stage acoustic modeling with ctc topology,","venue":null,"work_id":"0e83d6a6-dd9e-4a4b-8282-9d35f8d48d17","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.879782Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:6dd83673c0d85957962f5ac988b9ae54e3ea034d815468eeca0dd39ff74da70a","observation_id":"10e80c2f-73f4-4c60-b04a-aa19bcfc006b","resolution":{"observed_at":"2026-08-12T12:13:12.234353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.214416Z","title":"Imputer: Sequence modelling via imputation and dynamic programming,","venue":null,"work_id":"6da74628-5bf6-4b88-9911-dda06d2eb5e0","year":2020},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.884138Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:fcdee77087c14229cec2719813ca04fcb2c4793c761529c2a0fa4fb064fca435","observation_id":"5903ca51-3a82-4b88-a792-a8a449583128","resolution":{"observed_at":"2026-08-12T12:13:12.219564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.199217Z","title":"Global normalization for streaming speech recognition in a modular framework,","venue":null,"work_id":"64fe99a3-15cc-4c69-9293-2bb594ff5e3c","year":2022},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.888434Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:bb546247d7e3eb1a45848f99976831737df4f793d067869b22f86001c9a7572e","observation_id":"e9b2fdcd-caf4-44c9-880f-b99446e699a6","resolution":{"observed_at":"2026-08-12T12:13:12.204049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.184169Z","title":"An unsupervised autoregressive model for speech representation learning,","venue":null,"work_id":"a46262d5-d0d6-4da2-8ba4-485dae78fca6","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.893079Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:49ec21bbd9d565d203ac8cdb594bd3269df1ee342f4e8b81dcfd5d4a1e49f433","observation_id":"c55bfd57-f5ec-470f-bc88-34313b235760","resolution":{"observed_at":"2026-08-12T12:13:12.189145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.169205Z","title":"Variational inference with normalizing flows,","venue":null,"work_id":"c212a152-f2b5-422d-b12a-454fb381ec4a","year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.897533Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:46c63966da2fed16956d4c1f609ae0df6d72997044a9d81850c38b66919cf03f","observation_id":"7d281fd7-cbe5-4a1f-9e41-fb57c8f17546","resolution":{"observed_at":"2026-08-12T12:13:12.174075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.154293Z","title":"https://github.com/k2-fsa/icefall","venue":null,"work_id":"c009cc25-190a-4e15-84f2-e0f105a0d118","year":2021},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.901971Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:4e50959905067afc7c1137cb0535ebc9efc423a88de7c15ff3068b34a986d6b4","observation_id":"0d4597f1-bc0a-447f-9fe8-b7d039341609","resolution":{"observed_at":"2026-08-12T12:13:12.158985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.138418Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"9cc00695-41f4-40cf-a317-1a6655ba46c0","year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.906742Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:f2e4f8bc050f47bf056688e8f63b20d6a0ea06d78aa25365f3a9dff5902d9221","observation_id":"7eef7b32-dfc2-4500-b436-de80460cd04d","resolution":{"observed_at":"2026-08-12T12:13:12.143688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.122525Z","title":"Ted-lium 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":"85181b2f-6b1c-4c54-a67b-7ed085c3b149","year":2018},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.911102Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:112dd5ad938789a0af2f0d7e55ca3d8a339fc78145a47f757ebc480609200e02","observation_id":"343bbec1-16af-49d8-8430-fb1ee3a486aa","resolution":{"observed_at":"2026-08-12T12:13:12.127432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.107567Z","title":"A new algorithm for data compression,","venue":null,"work_id":"4aadd711-4d69-4954-9027-708ca2b88db7","year":1994},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.915698Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:d0bf231123290b487bddf5a54e10b86de5a4b493c5e7ac49b3f10102d9d1bb07","observation_id":"74753a00-dfa4-4b74-83f1-23b4aadd3664","resolution":{"observed_at":"2026-08-12T12:13:12.112275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-17T07:28:37.146698Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-12T12:13:11.920124Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.920124Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:24f1f79d76cb9f9da2ff1cc461ce933b40e4a6b645aebfa41b42da26640f1f52","observation_id":"1f671f66-86ad-4e7b-84ce-7b688cad4f50","resolution":{"observed_at":"2026-08-12T12:13:11.920124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-08-16T14:51:23.573469Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-12T12:13:11.925137Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.925137Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:534a8e84eaa4f407718b238244c47ff1779b37dc1c54814bb72e024e8b89574c","observation_id":"28b369b5-17ba-4972-859f-618ccaef638b","resolution":{"observed_at":"2026-08-12T12:13:11.925137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.092282Z","title":"Rnn- transducer with stateless prediction network,","venue":null,"work_id":"659dc890-e72e-42d6-be20-2e02be540ff7","year":2020},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.930273Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:ffc29ef204798ed09929656fe1dc8f41fb8e38863b036722fc5fe94038d5c089","observation_id":"250cd683-1af0-4a57-91ea-0b7d501eabd6","resolution":{"observed_at":"2026-08-12T12:13:12.097217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.076742Z","title":"Made: Masked autoencoder for distribution estimation,","venue":null,"work_id":"a04ae4d9-a05c-44e2-8bbb-12c952ad5926","year":2015},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.934933Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:b4198781c3dc87b8697265408a35449302250fb41d8b2c9753a93b13fd30a145","observation_id":"011b3b63-fd94-4e61-8ad7-803d89938d9e","resolution":{"observed_at":"2026-08-12T12:13:12.081969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:12.061406Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"a0d3fe1d-b0a5-4493-a432-b22131b9588a","year":2019},"citing_paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:11.939403Z"},"links":{"citing_paper":"/paper/2411.17537"},"observation_digest":"sha256:46609ac8e98a5bdc00bc304972ad2d71e26bc85045163e1353964283f82e5029","observation_id":"42beed4c-1604-49a0-8c7b-e468d514b2cb","resolution":{"observed_at":"2026-08-12T12:13:12.066442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17537","last_updated":"2024-11-26T15:53:13Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T05:23:00.327235Z","submitted_at":"2024-11-26T15:53:13Z","title":"Towards Maximum Likelihood Training for Transducer-based Streaming Speech Recognition"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2411.17537."}