{"as_of":"2026-08-08T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b16f0af4cf4c1d23fc15b581bb775064b13e3b9efccdcb199bfd080c04501e2a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:52:13.429143Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:52:11.502278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:52:13.916425Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"cited_work":{"arxiv_id":"2506.01439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01439","snapshot_observed_at":"2026-08-07T11:52:13.916425Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","venue":"cs.CL","work_id":"f4934a06-af18-4869-800f-9c41126496b5","year":2025},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.502278Z"},"links":{"cited_paper":"/paper/2506.01439","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:a5d1cf65bd499274ebebb4f8c3fcec1f90044b1b91597686d063dab0e17fd3fe","observation_id":"a252876d-78d3-4a80-840d-ecb6af7f9330","resolution":{"observed_at":"2026-08-07T11:52:13.943649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01439/citation-record","integrity":"/paper/2506.01439/integrity","json":"/paper/2506.01439/citation-record.json","paper":"/paper/2506.01439"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"cited_work":{"arxiv_id":"2506.01439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01439","snapshot_observed_at":"2026-08-07T11:52:13.916425Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","venue":"cs.CL","work_id":"f4934a06-af18-4869-800f-9c41126496b5","year":2025},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.502278Z"},"links":{"cited_paper":"/paper/2506.01439","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:a5d1cf65bd499274ebebb4f8c3fcec1f90044b1b91597686d063dab0e17fd3fe","observation_id":"a252876d-78d3-4a80-840d-ecb6af7f9330","resolution":{"observed_at":"2026-08-07T11:52:13.943649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.896182Z","title":"Next, acoustic features are extracted via SSL, w2v-BERT [18]","venue":null,"work_id":"8a86c8a5-a100-4282-8647-84e912a974c9","year":null},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.547934Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:bea9cc9b12823c36a7e366e8476e43672c4c34166d7a054ef469b185f4034be3","observation_id":"0f77035d-0147-4b16-baad-e1fd041d2959","resolution":{"observed_at":"2026-08-07T11:52:16.978017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.782384Z","title":"Training environments The training of the Whale model was conducted on an inter- nal server infrastructure","venue":null,"work_id":"b060342a-95cb-4f44-b704-893a524cf66a","year":null},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.605647Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:214580bc7aacfd8fac8357a3342e26840ba96c90f0661ae52b2919892fad2798","observation_id":"2f9d5ede-8e03-4a08-92ef-592195b8e6d6","resolution":{"observed_at":"2026-08-07T11:52:16.830710Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.703592Z","title":"Our experiments compare Whale against state-of-the-art systems such as Whis- per [14], OWSM [15], and OWSM CTC [17]","venue":null,"work_id":"1c660f77-9d48-43da-b88f-b4c9ad4d1487","year":null},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.643182Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:e5428c9ec2c9ea4e9d5d3106426c18a7c6baa40dc8ca040d49311bc6f3dd906e","observation_id":"3433c08c-7cc0-4712-b862-592fbe1d45be","resolution":{"observed_at":"2026-08-07T11:52:16.736939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.571419Z","title":"Through extensive experiments, we demonstrated that Whale achieves highly competitive performance on four benchmarks","venue":null,"work_id":"091d4de4-5ea7-4da1-af3e-0947095fafc3","year":null},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.720267Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:60c56495388c3969d336dddd40c2aac91ce01b638e3b089c97066cd396c8c87e","observation_id":"1417886d-095d-4671-90cd-e6b61244d221","resolution":{"observed_at":"2026-08-07T11:52:16.636351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.478529Z","title":"Common V oice: A Massively-Multilingual Speech Corpus,","venue":null,"work_id":"d2f0917e-a118-477c-a535-118b54897314","year":2020},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.799504Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:4c933d70aa7868afd691ec55868b853b202aa3be64cf06f9047a13703a3f2043","observation_id":"bc8a5bb4-9708-468d-9cd0-81121f30004f","resolution":{"observed_at":"2026-08-07T11:52:16.513195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.395643Z","title":"MUST-C: a multilingual speech translation corpus,","venue":null,"work_id":"59f8f3e7-6b9d-4d1e-98d4-9e854cdef2e3","year":2019},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.841152Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:63b03619147a349be345dc784521d3573f0080bb7fc271ecfa1e66b0fe49d612","observation_id":"9a9c02f2-0d4f-409a-88b5-5148b6a2e0c6","resolution":{"observed_at":"2026-08-07T11:52:16.435266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.315296Z","title":"The Multilingual TEDx Corpus for Speech Recognition and Translation,","venue":null,"work_id":"bb6162ba-0730-435f-99fa-a9cd14fb6d76","year":2021},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.886282Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:630a5a71786011106ac7b4f5485b2b83aebab15d3e9b3ff142921516967a771f","observation_id":"2f0bcc1e-e966-47a4-af83-e2e4a12150fe","resolution":{"observed_at":"2026-08-07T11:52:16.351072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.181504Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research,","venue":null,"work_id":"5b59f5b2-00c7-4819-966f-1b4b25499dcb","year":2020},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.943874Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:7a0fb3104f7d21f03d269702988dd6f343fd5c79f71517457ebb4ece282a2614","observation_id":"f1adea2b-c5bf-46b2-bfae-55fb7b7d90ea","resolution":{"observed_at":"2026-08-07T11:52:16.249441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:16.091504Z","title":"YODAS: YouTube-oriented dataset for audio and speech,","venue":null,"work_id":"fa182d30-2f63-4aee-a373-6ddcf7170125","year":2023},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:11.987325Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:0cdf8f05931ec920c435d2a3d510031cfe00bbf03dccd5545c16df390a3c0373","observation_id":"98fe1142-8d90-4b5c-9864-114a16c15be5","resolution":{"observed_at":"2026-08-07T11:52:16.131035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.986731Z","title":"FLEURS: Few-shot learn- ing evaluation of universal representations of speech,","venue":null,"work_id":"0d0f0ac5-4dd9-4301-a809-84ee7297e22c","year":2023},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.044617Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:9775555ce81e91bffbc275331390be9a6fd655b3b49cb390b33570930beab557","observation_id":"6b362eb3-980c-4b06-9e84-72d49be6ac16","resolution":{"observed_at":"2026-08-07T11:52:16.043916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09323","last_updated":"2021-12-17T05:09:44Z","snapshot_observed_at":"2026-07-06T12:19:51.150913Z","submitted_at":"2021-12-17T05:09:44Z","title":"JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09323","snapshot_observed_at":"2026-08-07T11:52:12.107639Z","title":"JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.107639Z"},"links":{"cited_paper":"/paper/2112.09323","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:e4e6f4207094201898afb801c740e352c9be75778ccd5d8c2dff5be7395a7d75","observation_id":"73f4e7b9-83cf-4188-a662-2f5856a3235e","resolution":{"observed_at":"2026-08-07T11:52:12.107639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7488/ds/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.491448Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,","venue":null,"work_id":"b0963ffe-9658-4e12-968c-593495549a90","year":2017},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.188880Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:ff46f53103806f3bb9c8d15a9137579f602370762f760af031088fd69e934583","observation_id":"650a4083-b23e-48c1-b995-12d781bcf2ab","resolution":{"observed_at":"2026-08-07T11:52:13.540449Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.876896Z","title":"Multilingual speech recognition with a single end-to-end model,","venue":null,"work_id":"0967ebc9-6aa6-45bf-8a53-5d15134c2902","year":2018},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.220385Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:b9570f6b475c22bd3ad39fbe996f6b4c6f66d694424c40b17ba91691c064f006","observation_id":"78e257a2-8c00-4ad1-b187-59b56b892abb","resolution":{"observed_at":"2026-08-07T11:52:15.911834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.809325Z","title":"Bytes are all you need: End-to-end multilingual speech recognition and synthe- sis with bytes,","venue":null,"work_id":"d470f4ed-1d48-4e86-bb3f-2cf3321b680f","year":2019},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.267009Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:68de3feec924332daaf3d873dd82ed40addf7202d4d439ef550eef5e1e4b9908","observation_id":"fa894e38-556e-40b8-99e1-a2f9d11da06f","resolution":{"observed_at":"2026-08-07T11:52:15.841719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.661262Z","title":"An end-to-end language-tracking speech recognizer for mixed- language speech,","venue":null,"work_id":"d9819449-98f2-4d64-9df1-c6b04a08a2d5","year":2018},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.301077Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:0dec677bc370cfcf3a8a2887a98c48d1d9fb2186c0135eb83f1a1affa91ffa98","observation_id":"5bfcfb12-120f-4947-b09e-cd170152f762","resolution":{"observed_at":"2026-08-07T11:52:15.766281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.566211Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"968a5961-732c-431d-8be7-96c779a26d61","year":2024},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.341225Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:77a6b366ccbb7bf631bd52942d2740aaa4cc3c5c4811185bc48d9896f5811219","observation_id":"311203d9-ad28-40e3-9bf6-0d263da0384b","resolution":{"observed_at":"2026-08-07T11:52:15.610423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.463280Z","title":"Less is More: Accu- rate Speech Recognition & Translation without Web-Scale Data,","venue":null,"work_id":"81ef2faf-5312-469a-bf6c-20c1d0498996","year":2024},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.393041Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:23d64b692450c675268b29876b27b361513695ac8eabfcb639e0972b494a67b2","observation_id":"2563d107-58fd-442a-a3a4-0dafbc238378","resolution":{"observed_at":"2026-08-07T11:52:15.517326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.424757Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.424757Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:cfde9396d75fd4df8650b4cbdaee1b9afd1ec67bd04358807c2f7a632ef7991c","observation_id":"3265a550-d7cc-4745-8430-3c2bfaacfb83","resolution":{"observed_at":"2026-08-07T11:52:12.424757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16658","last_updated":"2024-08-27T02:15:49Z","snapshot_observed_at":"2026-07-06T17:22:11.359057Z","submitted_at":"2024-01-30T01:22:18Z","title":"OWSM v3.1: Better and Faster Open Whisper-Style Speech Models based on E-Branchformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16658","snapshot_observed_at":"2026-08-07T11:52:12.485510Z","title":"OWSM v3.1: Better and faster open whisper-style speech models based on e-branchformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.485510Z"},"links":{"cited_paper":"/paper/2401.16658","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:ffed31c28a02176930503853c837e6dd6e795df559bc6bcee0a435fe02326c81","observation_id":"605a18c1-61fa-42f9-94ba-d87ffb96b2bc","resolution":{"observed_at":"2026-08-07T11:52:12.485510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.332508Z","title":"Reproducing whisper-style train- ing using an open-source toolkit and publicly available data,","venue":null,"work_id":"fb50b7ee-6293-46f0-afc3-ad0d0bb1e8e9","year":2023},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.552905Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:bb977ed6aa469452fa63fce6d1f86fe4648bba8d9cb652a9b51faeff1475dc55","observation_id":"fc862e2b-0f58-424c-aa00-ae35ff0b686e","resolution":{"observed_at":"2026-08-07T11:52:15.403774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12654","last_updated":"2024-08-27T02:22:00Z","snapshot_observed_at":"2026-07-06T17:32:36.489908Z","submitted_at":"2024-02-20T02:04:38Z","title":"OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12654","snapshot_observed_at":"2026-08-07T11:52:12.584687Z","title":"OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.584687Z"},"links":{"cited_paper":"/paper/2402.12654","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:9d6af5e1e87188e70836e027712cfb900f304186456e6423a412bf7a2f6fe101","observation_id":"50267203-235d-4053-ad36-6890cc280f96","resolution":{"observed_at":"2026-08-07T11:52:12.584687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:15.178226Z","title":"W2v-BERT: Combin- ing contrastive learning and masked language modeling for self- supervised speech pre-training,","venue":null,"work_id":"1bb83d3c-44bd-4fe3-b5b7-b63044aaf418","year":2021},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.616796Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:e741c2865531e3c581dba5893439e60f74021892ee0aa6c5347d76d0704c2311","observation_id":"f10c69b4-4f34-4a7e-b299-239bd01d81d7","resolution":{"observed_at":"2026-08-07T11:52:15.277095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.996367Z","title":"E-Branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":"990100a1-b098-427c-a632-40c5b7385ba9","year":2023},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.663181Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:bade0f65de50dd096c34c8d2ddbda9269949fc91a0b8c6b8b12ef4fbc8d25e2b","observation_id":"392efdd9-04e1-45a4-a835-f1609dda7824","resolution":{"observed_at":"2026-08-07T11:52:15.070525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.696914Z","title":"Joint CTC-attention based end-to-end speech recognition using multi-task learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.696914Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:55f2a6b0795029eaf94b27bfe66c198447d0d9e4a67f189a32ba9b681a69a3c1","observation_id":"76402194-0a96-4528-ae06-4065c2867c11","resolution":{"observed_at":"2026-08-07T11:52:12.696914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.885455Z","title":"Joint CTC/attention decoding for end-to-end speech recognition,","venue":null,"work_id":"52d9f9f1-68b3-4863-a3e8-122ebe29fd5c","year":2017},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.731205Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:2b658935b509509b977412ab638095445d5d42de68ae510eaa6c1c54c959fc21","observation_id":"fe796955-e6fc-4b6c-9fa6-174890ae8a31","resolution":{"observed_at":"2026-08-07T11:52:14.920584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.768004Z","title":"Curricu- lum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.768004Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:bd60d119c3e299fa1261838a69bf58da43daa81a498a86707b296da91fd542d5","observation_id":"f7885cbb-39de-4366-a5d4-ac178db87a6d","resolution":{"observed_at":"2026-08-07T11:52:12.768004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.818208Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.818208Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:95ac4c397302c756ec08b034043d3db7d359b3dd197acc372bc323181f62b12d","observation_id":"bfe986cd-b310-4754-9f27-fa52c31e4d7e","resolution":{"observed_at":"2026-08-07T11:52:12.818208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.759316Z","title":"Corpus of Spontaneous Japanese: Its design and evaluation,","venue":null,"work_id":"05d136c5-fed4-4aef-8dff-42dc4e4321a7","year":2003},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.868330Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:b58764e05dbfa8bf681803d8ae360bf89b9b6d37a88470506ff9c478212965c2","observation_id":"e35690d9-1d5c-4bae-9702-28be96da4503","resolution":{"observed_at":"2026-08-07T11:52:14.805916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.641168Z","title":"Better Intermediates Im- prove CTC Inference,","venue":null,"work_id":"60068c30-c563-49f8-8ee1-db24a61be58e","year":2022},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.914300Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:864a6f91e4927b675819948f8a5f1dbc4eb107bcf02868cbd34a87e2a6338e03","observation_id":"3697c5d3-97ab-4c57-95d5-efef034997a1","resolution":{"observed_at":"2026-08-07T11:52:14.691919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T11:52:12.946413Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:12.946413Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:bfcac4ad572ed12bdbf5e7094259ae10c02e41adb0b784c7f2d7dc78a774837f","observation_id":"20437515-acb6-4b91-b9d7-5f37dc3b25b5","resolution":{"observed_at":"2026-08-07T11:52:12.946413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06371","last_updated":"2024-11-21T10:45:39Z","snapshot_observed_at":"2026-07-06T18:28:12.010251Z","submitted_at":"2024-06-10T15:32:42Z","title":"mHuBERT-147: A Compact Multilingual HuBERT Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06371","snapshot_observed_at":"2026-08-07T11:52:13.029649Z","title":"mHuBERT-147: A Compact Multilingual HuBERT Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.029649Z"},"links":{"cited_paper":"/paper/2406.06371","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:d35d19e17aa9fbe2c04100ea0b7bd82b73406f116dc06b100df87efd9c4754af","observation_id":"99580925-0466-4f65-8f2b-596a39776f07","resolution":{"observed_at":"2026-08-07T11:52:13.029649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.500993Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"e53e5857-945a-4f3f-b063-84799a724ed8","year":2022},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.100295Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:910609c9c3c33e52b5c3e0fdcf8fb90ece174c1fad4b5575594edd43763ad9ad","observation_id":"1b7f548d-d52f-445d-a734-7b8eab3ee7e0","resolution":{"observed_at":"2026-08-07T11:52:14.569887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12611","last_updated":"2024-06-18T13:38:58Z","snapshot_observed_at":"2026-08-08T13:45:19.017946Z","submitted_at":"2024-06-18T13:38:58Z","title":"Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting","version":1},"cited_work":{"arxiv_id":"2406.12611","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12611","snapshot_observed_at":"2026-08-07T11:52:13.704831Z","title":"Rapid Language Adaptation for Multilingual E2E Speech Recognition Using Encoder Prompting","venue":"cs.SD","work_id":"56183b9f-6807-4ba9-aff7-50cb2ab7f2c6","year":2024},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.181595Z"},"links":{"cited_paper":"/paper/2406.12611","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:e7288f1204a8a83ee40b5d7bdcb80141c554cd391f2f279e18dfcdcccc17a0ff","observation_id":"ea4af69f-db0d-4996-b02e-a97bae4e6ee7","resolution":{"observed_at":"2026-08-07T11:52:13.768823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.369616Z","title":"ESPnet: End-to-End Speech Processing Toolkit,","venue":null,"work_id":"ef08e84b-4e52-4648-bbde-3fe78bdd3a7a","year":2018},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.244378Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:e76737520243c898a9ece1ee28cdc507f364fe5d5a604d23230f87e5d57eb78a","observation_id":"90e0db55-7011-4431-a972-edaf52a54976","resolution":{"observed_at":"2026-08-07T11:52:14.425893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.195526Z","title":"VoxPopuli: A large-scale multilingual speech corpus for representation learning, semi- supervised learning and interpretation,","venue":null,"work_id":"c743230f-bb29-4264-ba62-806e4f41d8fb","year":2021},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.283183Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:1948109f640172bc1c2da719a8d0308d057eac2e9402cc4bef87799cfb3ee759","observation_id":"04f43e6e-ec3e-42fd-b475-676edde6c505","resolution":{"observed_at":"2026-08-07T11:52:14.303262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:14.004106Z","title":"WenetSpeech: A 10000+ hours multi-domain mandarin corpus for speech recognition,","venue":null,"work_id":"bc5a6c43-409f-4f90-bcc9-2823a7a9871d","year":2022},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.348188Z"},"links":{"citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:b1719cde7919f22e91bd853feaba847e325ff9d13ac9def6c88cc7987e8c55d5","observation_id":"ab385ad2-7bb1-4b5f-8866-364ceb3501c4","resolution":{"observed_at":"2026-08-07T11:52:14.075308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T11:52:13.381090Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for com- mercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.381090Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:6f86abfd13d4084873ad21ddf4183fefd293b50ad47192b8616515a5b92d1a22","observation_id":"7b443f9f-0199-4440-9394-983dbf2e8ece","resolution":{"observed_at":"2026-08-07T11:52:13.381090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10881","last_updated":"2022-01-26T11:41:55Z","snapshot_observed_at":"2026-08-06T15:56:29.468995Z","submitted_at":"2022-01-26T11:41:55Z","title":"The Norwegian Parliamentary Speech Corpus","version":1},"cited_work":{"arxiv_id":"2201.10881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10881","snapshot_observed_at":"2026-08-07T11:52:13.633582Z","title":"The Norwegian Parliamentary Speech Corpus","venue":"cs.CL","work_id":"c4aea00c-21bf-4582-92c2-0c699a57a5a0","year":2022},"citing_paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:13.429143Z"},"links":{"cited_paper":"/paper/2201.10881","citing_paper":"/paper/2506.01439"},"observation_digest":"sha256:0ac4cf0717857630950491b31d3b7c33a3334b692ac5696e871ca778b59d3de7","observation_id":"91d8f7c5-bb41-4732-a8d5-9f66d7a0a411","resolution":{"observed_at":"2026-08-07T11:52:13.658600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01439","last_updated":"2025-06-02T08:52:50Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:40:35.396315Z","submitted_at":"2025-06-02T08:52:50Z","title":"Whale: Large-Scale multilingual ASR model with w2v-BERT and E-Branchformer with large speech data"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.01439."}