{"as_of":"2026-08-15T10:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e236031d0a6794bff51df94e1e1edb5a08b342772fdea5ff79ab91e239c1df4b","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:40:58.184272Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:40:55.130431Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:40:58.467883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"cited_work":{"arxiv_id":"2505.21527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21527","snapshot_observed_at":"2026-08-07T14:40:58.467883Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","venue":"eess.AS","work_id":"6f0bcd22-733e-48ab-85d5-97245b5e798e","year":2025},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.130431Z"},"links":{"cited_paper":"/paper/2505.21527","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:2672afbd87dd37ed441ce5adfa2b0ccbda66f139f69487802fafaac602c28f48","observation_id":"65d84a78-a98e-4a4b-8675-03b7925b264d","resolution":{"observed_at":"2026-08-07T14:40:58.530962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21527/citation-record","integrity":"/paper/2505.21527/integrity","json":"/paper/2505.21527/citation-record.json","paper":"/paper/2505.21527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"cited_work":{"arxiv_id":"2505.21527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21527","snapshot_observed_at":"2026-08-07T14:40:58.467883Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","venue":"eess.AS","work_id":"6f0bcd22-733e-48ab-85d5-97245b5e798e","year":2025},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.130431Z"},"links":{"cited_paper":"/paper/2505.21527","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:2672afbd87dd37ed441ce5adfa2b0ccbda66f139f69487802fafaac602c28f48","observation_id":"65d84a78-a98e-4a4b-8675-03b7925b264d","resolution":{"observed_at":"2026-08-07T14:40:58.530962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:05.559454Z","title":"It adopts the model architecture of wav2vec 2.0 [13], comprising a CNN feature extractor to convert waveform into a local feature, and a trans- former as the context network","venue":null,"work_id":"648386b9-62aa-4b38-81e7-bd627e8ea0f8","year":null},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.232252Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:0e41fae83eaeb5979c916f71cedccc71132bc87950a7a37b897024fd9da11dae","observation_id":"de4a9de8-727f-4be7-9c6f-5a146bfde3bf","resolution":{"observed_at":"2026-08-07T14:41:05.641541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:05.312040Z","title":"The design of VietASR focuses on two key aspects: • Adapting HuBERT-style multi-iteration pre-training to Zip- former encoder for better efficiency and practicality","venue":null,"work_id":"3101eec5-3639-4233-94d4-ee8051b25f76","year":null},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.303805Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:4a4afb6954199cc7cf2e4e6413ed267bb5cb9537143470c04d5e1723e95d9da1","observation_id":"5dbe9ec4-d12b-401b-beeb-e6b904a1eed6","resolution":{"observed_at":"2026-08-07T14:41:05.441209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:05.102497Z","title":"Experimental Setups DatasetWe collect approximately 70,000 hours of unlabeled audio from YouTube and apply FunASR V AD [29] for auto- matic segmentation","venue":null,"work_id":"7b7bfab8-88a0-478a-b549-d364a8ecf991","year":null},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.379910Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:9c33cf73604ed479dd7c4fdce768c8eaedc6a18e429e4893348b07fbe6e5f48f","observation_id":"9f97d229-19dc-4b6d-8446-ca676a4dd1c6","resolution":{"observed_at":"2026-08-07T14:41:05.219853Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.972895Z","title":null,"venue":null,"work_id":"92761e9b-ba39-4795-b47d-6d1143e0c631","year":null},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.498131Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:f2ffad6234552eeeca05680c98386e74d6addc81cf17536a269ed50b2ae57675","observation_id":"12a84b64-3423-4ba8-9df2-21edc5846b27","resolution":{"observed_at":"2026-08-07T14:41:05.029933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.877084Z","title":"62206171 and No","venue":null,"work_id":"f39d5626-9f1f-4102-bdbb-b77c0b4131be","year":null},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.571186Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:95bffc5af9f00b06385284d3757ee6c5f4bbe232c9f4c16c7ed6a96ef143dbea","observation_id":"24d531c7-ee05-4133-b175-ae598a2439d6","resolution":{"observed_at":"2026-08-07T14:41:04.912706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:55.658199Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.658199Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:2c09af7b7c8e4188cb666ca979f971cf4072bda04fe25a7dc2c6f4d1cd987f91","observation_id":"db0fa5a5-0772-41f2-8273-e38ff4257fec","resolution":{"observed_at":"2026-08-07T14:40:55.658199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.771830Z","title":"Speech recognition with deep recurrent neural networks,","venue":null,"work_id":"2ea886c7-5ab8-468f-a21a-07848e394cd9","year":2013},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.766974Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:9d63ef932146e59cde5c1c2891908e59e6e1eb32ef0b13e98c655ffde13c8429","observation_id":"c7210083-2055-4e58-8d4d-7c8dbe2a9246","resolution":{"observed_at":"2026-08-07T14:41:04.839881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.599981Z","title":"Recent advances in end-to-end automatic speech recognition,","venue":null,"work_id":"8d3132f8-768e-4adf-a694-315c9c18233e","year":2022},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.863145Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:3d65f41043ad619365f1b7fe8257c6a1d5bc94a35a75335057f9c119a733be42","observation_id":"46c7cb3a-cb57-4af3-bf3f-45df80f2affb","resolution":{"observed_at":"2026-08-07T14:41:04.686802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.425534Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"5aa649e7-2214-4f09-8ed4-9606788b4e44","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:55.954085Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:8f922c51ed08ddb5d5657353cec5af2ac9417917546eb1eb0df73e013615b297","observation_id":"8a6f43b9-dfd4-460c-b9d2-12670fcff2cc","resolution":{"observed_at":"2026-08-07T14:41:04.497093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19674","last_updated":"2024-06-28T06:22:23Z","snapshot_observed_at":"2026-08-12T23:33:06.783203Z","submitted_at":"2024-06-28T06:22:23Z","title":"Less is More: Accurate Speech Recognition & Translation without Web-Scale Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19674","snapshot_observed_at":"2026-08-07T14:40:56.020123Z","title":"Less is more: Ac- curate speech recognition & translation without web-scale data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.020123Z"},"links":{"cited_paper":"/paper/2406.19674","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:570bb6f3b1edd38fe350ebb7015fe4cb920420d10d94eab5444609a4149faa02","observation_id":"7e660ff5-0a7d-4bfe-af5a-21dc603fa87a","resolution":{"observed_at":"2026-08-07T14:40:56.020123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09841","last_updated":"2024-04-16T14:55:13Z","snapshot_observed_at":"2026-08-14T13:08:06.020991Z","submitted_at":"2024-04-15T14:48:43Z","title":"Anatomy of Industrial Scale Multilingual ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09841","snapshot_observed_at":"2026-08-07T14:40:56.096569Z","title":"Anatomy of industrial scale multilingual ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.096569Z"},"links":{"cited_paper":"/paper/2404.09841","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:16ddfd4845dff09c2101115ef0a8712e65e67c933f8e713da84f9317711b2f67","observation_id":"0f183e45-2c90-4043-b9b8-0574e6dcc66e","resolution":{"observed_at":"2026-08-07T14:40:56.096569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.253496Z","title":"XLS-R: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"96042156-9c06-4a7b-b858-ed84ed8bb802","year":2022},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.186777Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:342f03ecc708149d6ea37e6939688a17cc28bbe4db9de31d7dac11a3e0e05349","observation_id":"6a1c20a4-59bd-408a-b4fc-cb394ee91ef2","resolution":{"observed_at":"2026-08-07T14:41:04.326056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-13T12:33:46.085209Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T14:40:56.281578Z","title":"Google USM: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.281578Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:34cec2ecb8f5b4bfe75ccc6f16bab12503b0c8a5c936212c439f5ac81869b301","observation_id":"5adc19bc-4bbb-4c92-a428-b302d83d4cb9","resolution":{"observed_at":"2026-08-07T14:40:56.281578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:04.045047Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"410e684f-ddff-4a5c-a086-ce362e1429f3","year":2024},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.362854Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:6926a8edb00382a735f8d1ac51ffe65d5f6c90801ce78efc45b8e2ed7c635166","observation_id":"bf33fbb6-29df-4d59-af0c-fe2aa7e6f159","resolution":{"observed_at":"2026-08-07T14:41:04.155444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11546","last_updated":"2025-05-27T04:49:35Z","snapshot_observed_at":"2026-08-12T23:41:05.299596Z","submitted_at":"2024-06-17T13:44:20Z","title":"GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11546","snapshot_observed_at":"2026-08-07T14:40:56.424529Z","title":"GigaSpeech 2: An evolving, large-scale and multi-domain ASR corpus for low-resource lan- guages with automated crawling, transcription and refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.424529Z"},"links":{"cited_paper":"/paper/2406.11546","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:bf343214d0beae6ccfbb07c1920f9ef96c5c8c4279e9d3911094951d32c4c68b","observation_id":"9d714c57-19f2-4fc1-b1f0-5d52f075dc74","resolution":{"observed_at":"2026-08-07T14:40:56.424529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:03.892695Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":"f047a26d-cf87-445d-9399-f4d6102e63ea","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.494520Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:c8a348e457f491df033398b79db90e64dc4f5f74c44c39c709f2adf595469f37","observation_id":"8cdb175a-606e-4f95-97ee-14b6c4999a41","resolution":{"observed_at":"2026-08-07T14:41:03.960241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:03.688877Z","title":"HuBERT: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"03c8ef0e-be82-4d2a-a982-e1314b595deb","year":2021},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.588835Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:42013f0a85320b5b462eb385428baeca90899814799d6741683ef25c32988e19","observation_id":"f24ae292-a21b-4712-b1c4-823fff75c31d","resolution":{"observed_at":"2026-08-07T14:41:03.779728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:56.682166Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.682166Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:f8711db9befbaab1f25a707300bfe28f9e900603d40c2249da055cc649937827","observation_id":"bb4dee4f-b0de-49fb-b540-82fc9a03338b","resolution":{"observed_at":"2026-08-07T14:40:56.682166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:03.482714Z","title":"Supervision-guided codebooks for masked prediction in speech pre-training,","venue":null,"work_id":"b406bc64-bc4a-4ccf-837d-1dced38b28ea","year":2022},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.778761Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:f201ccb9e3bf77f86bec422921aa9185a6ce1f12e8e551b67c84429b76384dce","observation_id":"9c77a193-e8f3-4991-bd30-1b4ee2e889cb","resolution":{"observed_at":"2026-08-07T14:41:03.566036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:03.210966Z","title":"Pushing the limits of unsu- pervised unit discovery for SSL speech representation,","venue":null,"work_id":"88d776cf-1bc9-45f6-8114-ea880bd1200e","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.853270Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:defc0fecccdbe2d6d6e3e5b1492ded01ad09dce4232d9dee99bc944b2824036e","observation_id":"b1889d01-5a99-4ba5-8a77-8513df587842","resolution":{"observed_at":"2026-08-07T14:41:03.381198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:03.007432Z","title":"Speech pre-training with acoustic piece,","venue":null,"work_id":"0988037f-c88f-402d-8e4d-8266af10cb28","year":2022},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.933645Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:6e9805f134eec2f26ea573d99c682a110eac74ef8ea1f485853285e2f7c33c36","observation_id":"cd1d3ff6-1d00-49e3-933d-9b7a6d7ea321","resolution":{"observed_at":"2026-08-07T14:41:03.136150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:02.800106Z","title":"Reducing barriers to self- supervised learning: HuBERT pre-training with academic com- pute,","venue":null,"work_id":"62ca70ab-5d82-45d9-9909-c5a0651f65be","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:56.994242Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:4b9e93ba6cb56fed4cd5b635561f849934251d5af49b3f2f13e79500a45e29a7","observation_id":"2d57d349-ba99-4a16-8e7e-dd06cb8d2102","resolution":{"observed_at":"2026-08-07T14:41:02.934554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:02.504083Z","title":"ASBERT: ASR-specific self-supervised learning with self-training,","venue":null,"work_id":"938f2739-7850-4fe9-84bd-65625ba6cd76","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.073591Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:90a0450a469738e2a03cadfa24544f89c400e087b0c21f038ff83287c1ddf1ba","observation_id":"94c5224f-f293-4030-af5c-3a042eed7213","resolution":{"observed_at":"2026-08-07T14:41:02.650999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:02.151457Z","title":"Biased self-supervised learn- ing for ASR,","venue":null,"work_id":"7fd38432-31af-4b40-be30-3a26045428c3","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.144964Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:f63aaa2c0ce856741027577f7148431b5fda34d6c3516e4e5c2e6c256f46be56","observation_id":"e735ec1a-48bc-4e48-a036-95e1a21efbb3","resolution":{"observed_at":"2026-08-07T14:41:02.340163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:01.885959Z","title":"CTCBERT: Advancing hidden-unit BERT with CTC objectives,","venue":null,"work_id":"c6a38dc6-608c-47a9-9c0c-289ab9d8ed4c","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.219215Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:40cab163d3e60c8fbc464d33a517544ffe3f2f6382f2c869f13962c4c07fb5f8","observation_id":"658cafe9-371f-4274-aae1-8e9ca793f995","resolution":{"observed_at":"2026-08-07T14:41:02.014116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:01.516499Z","title":"MelHuBERT: A simplified hubert on mel spectrograms,","venue":null,"work_id":"c0f8bb87-13b7-4af2-9d4d-d6a5af7344fa","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.310320Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:57bf8add421855c53967b1a2cb5c66f9c7f59b122795c7b7e491b655a10fc699","observation_id":"185faf4b-8ad9-4b2e-8450-615775fb5044","resolution":{"observed_at":"2026-08-07T14:41:01.731030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:01.124071Z","title":"Fast-HuBERT: an efficient train- ing framework for self-supervised speech representation learn- ing,","venue":null,"work_id":"d436c1e6-72a0-431a-825e-082b1329b004","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.395838Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:12cff5af2f4717d956bf961d040453ed673d4f72141d23d5df6da7f54ee5f9ab","observation_id":"8b294522-c8e7-47d9-a11a-fb2f6d81e137","resolution":{"observed_at":"2026-08-07T14:41:01.310181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17100","last_updated":"2025-03-22T04:46:03Z","snapshot_observed_at":"2026-08-12T21:10:16.008523Z","submitted_at":"2024-11-26T04:37:11Z","title":"k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning","version":2},"cited_work":{"arxiv_id":"2411.17100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17100","snapshot_observed_at":"2026-08-07T14:40:58.287735Z","title":"k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning","venue":"eess.AS","work_id":"663d812d-ea05-48f4-bbeb-cd04561d8eb8","year":2024},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.467662Z"},"links":{"cited_paper":"/paper/2411.17100","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:304f136dae6a653e837e36339c0afbac33f4dece23b0b26e975f928f9ad6483b","observation_id":"2ff276ab-f86e-4d6c-8636-b72a67c6d58f","resolution":{"observed_at":"2026-08-07T14:40:58.375212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:00.752813Z","title":"Attention is all you need,","venue":null,"work_id":"1c05591b-efa3-461a-8b03-13fdc88baa05","year":2017},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.531863Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:d9cd44f2ecb7ef18b2c170e9b2618c12e6d6ac3160cbb7c788f26029a8909fe8","observation_id":"60473076-953f-4088-af91-15110098a2d7","resolution":{"observed_at":"2026-08-07T14:41:00.911254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:00.413631Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":"1772028e-4802-4d27-9cff-cf35a40a01a1","year":2020},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.586322Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:c0031e56af2c4ebd7e894ee27edd7b691385f36bc3afa01dd521f243eff7ac0e","observation_id":"2866d0b3-6706-4cf5-b9be-3d13cf691ab2","resolution":{"observed_at":"2026-08-07T14:41:00.564659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:41:00.132254Z","title":"RNN-Transducer with state- less prediction network,","venue":null,"work_id":"7d9874ec-80c7-45a9-a0fd-a35fdacc9141","year":2020},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.645961Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:fdf1013f0f40b150989133a399fb0dd948f236107a8f38dc69bdc09d1b8f3113","observation_id":"bfb2ddae-a7b0-40a6-8b5d-1d7790a0916a","resolution":{"observed_at":"2026-08-07T14:41:00.246108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-07T14:40:57.720390Z","title":"Sequence transduction with recurrent neural net- works,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.720390Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:a272033504845754b17c93e5e35c9b2c4488cc5e94e7f40461216c4e72b819b6","observation_id":"6df46cdf-ec7c-4aa0-9c51-f867afb16a66","resolution":{"observed_at":"2026-08-07T14:40:57.720390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:59.835062Z","title":"Pruned RNN-T for fast, memory-efficient ASR training,","venue":null,"work_id":"f282c143-762a-4d17-ad8e-4523dc681f7e","year":2022},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.796255Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:3a9f4cbad970fbc05e64871246ac58b6c3ef185bb5165eeb6d6ff938a25cbb3c","observation_id":"17bfa531-9525-4c70-9cab-eab692c8a0b6","resolution":{"observed_at":"2026-08-07T14:40:59.975823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:59.595558Z","title":"FunASR: A fundamental End-to- End speech recognition toolkit,","venue":null,"work_id":"10d38da7-6e3c-44c9-86a4-f4f24a878fea","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.848494Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:34d989ce7472c4c469d645ef558e6ae49948b7e72206ce9890bb16782a9e6be8","observation_id":"9d6a4ccd-2d8c-43a2-9cfa-42e0e0700a4d","resolution":{"observed_at":"2026-08-07T14:40:59.717498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:59.361315Z","title":"Common V oice: A massively-multilingual speech corpus,","venue":null,"work_id":"6a5cbf3b-47b4-4169-b6f4-a7b7187395ce","year":2020},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:57.931707Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:fc90f6524d3cd3dd12d5fadf2ac771ce78dc6161a0191c2d3cab12a7be18340d","observation_id":"3b60f1d2-e23b-4994-a296-d4af54a2c6c4","resolution":{"observed_at":"2026-08-07T14:40:59.486033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:59.097781Z","title":"FLEURS: Few-shot learn- ing evaluation of universal representations of speech,","venue":null,"work_id":"fa218819-c80a-4c38-91ed-552665e1f096","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:58.026886Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:79c1a0e2d2ba3a3f006cc7135c573e62963d6a52d8b2339c85a8cb7fec986257","observation_id":"345f2766-ae97-4c6b-9007-eaf692de65a8","resolution":{"observed_at":"2026-08-07T14:40:59.200412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:58.782927Z","title":"Neural machine transla- tion of rare words with subword units,","venue":null,"work_id":"30e5e2aa-3e0c-477e-b52c-06376666560d","year":2016},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:58.101291Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:bf7f12af9bedee6360b5c368733fcbdeda56e6b14d6c28e7b74c155aaa418737","observation_id":"fac63337-1850-4832-86db-c98048697c26","resolution":{"observed_at":"2026-08-07T14:40:58.936309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:40:58.538128Z","title":"Fast and parallel decoding for transducer,","venue":null,"work_id":"1a5ee333-abae-4397-9d01-2b50e96e0868","year":2023},"citing_paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:40:58.184272Z"},"links":{"citing_paper":"/paper/2505.21527"},"observation_digest":"sha256:0919b0657d5f49dc74e4e58d9044c1fa82aa8c22b3e03a7aeb9ff14b33116318","observation_id":"0ee7bf36-b861-4bc0-8496-1a9ee5d44281","resolution":{"observed_at":"2026-08-07T14:40:58.620250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21527","last_updated":"2025-05-29T12:55:12Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T09:31:26.053219Z","submitted_at":"2025-05-23T14:26:11Z","title":"VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2505.21527."}