{"as_of":"2026-08-18T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ced0d6b96ee48e7f248d40c3a6762409babfdbd3fddf368364c4e1d37946f629","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:57:42.593345Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.13497/citation-record","integrity":"/paper/2501.13497/integrity","json":"/paper/2501.13497/citation-record.json","paper":"/paper/2501.13497"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:43.031422Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":"e8ff3a62-05a1-4753-bfc9-2ed5966037e3","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.452345Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:d2c56b6263fae96476412302a42b3d7e16cba588212f5fce16a77509e815c0cb","observation_id":"a9fc8469-598e-4b1d-920d-c5ba76a42b81","resolution":{"observed_at":"2026-08-10T15:57:43.034896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:43.021363Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition,","venue":null,"work_id":"ecf903da-151b-436d-81dc-d4ce4fa6fa46","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.456679Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:352e8fe0d906ed47ce5b8f53f0d8bbc280ace0295cb8d45321369bd5b0883c2c","observation_id":"9667b6c9-82b5-4980-9592-2f540f31df3f","resolution":{"observed_at":"2026-08-10T15:57:43.025128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:43.011950Z","title":"Katzner and K","venue":null,"work_id":"66dbd413-3c19-4a05-9642-65d946e15da0","year":2002},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.460550Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:4d26c0dba35e426b0aabba478b5bbc3344eda26e7af23fc6b04f96587dacf339","observation_id":"5fbe5396-558c-4ef8-b2d9-f9678309ac45","resolution":{"observed_at":"2026-08-10T15:57:43.015233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:43.002016Z","title":"XLS-R: Self- supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"bb7535f2-e0c4-4530-a506-2c4ee137a9e6","year":2015},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.464182Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:87c7b0c050f99ed597aed10ef9862bd849b1f373b4c50e44a73865c625fc378b","observation_id":"deb73cae-7927-4e55-acc4-9b4dab257d2d","resolution":{"observed_at":"2026-08-10T15:57:43.005777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.992504Z","title":"Self- supervised learning with random-projection quantizer for speech recognition,","venue":null,"work_id":"f58d6e83-adfc-4398-84fa-7074b9afc79e","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.468005Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:2f3771876861e2a139951bb8958b5c3646b5245a5970e8664153096079ef5729","observation_id":"10cdc0bb-4350-4c6e-ba7d-c7f358df2a47","resolution":{"observed_at":"2026-08-10T15:57:42.995920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.982633Z","title":"Unispeech: Unified speech rep- resentation learning with labeled and unlabeled data,","venue":null,"work_id":"dd3dffa4-ea1e-4d59-9e4a-e0ef7758f42d","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.471609Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:405209e51a76f7393e9929040f20d64af3fabec20e7513ba21307bb5a5de0e95","observation_id":"33206125-1e87-4aba-ad17-79d53dd06993","resolution":{"observed_at":"2026-08-10T15:57:42.986303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.972280Z","title":"Tranusr: Phoneme-to-word transcoder based unified speech representation learning for cross-lingual speech recognition,","venue":null,"work_id":"e21017f5-450b-4918-9069-6e8afcc1cb01","year":2023},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.475304Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:d33f63868f75b6731cb033ddc79a8bc0084f8a52f0e2835e8f4c5a8b7e4bf1c3","observation_id":"839da7ef-59e2-4cfe-b4d8-c4d78e277e78","resolution":{"observed_at":"2026-08-10T15:57:42.975883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.962694Z","title":"Data2vec: A general framework for self- supervised learning in speech, vision and language,","venue":null,"work_id":"cc789f0e-160f-4a85-8481-249e5f75e474","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.478559Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:9aad4a812abfc8423a53936d5c374c1dfcae515fd5013291632eb2d162c12b99","observation_id":"2658c87a-0064-41bf-99ce-9882d5ad6911","resolution":{"observed_at":"2026-08-10T15:57:42.966144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.953402Z","title":"Mo- mentum contrast for unsupervised visual representation learning,","venue":null,"work_id":"79511e2d-3e41-4868-8bfd-fe5b17fe8af0","year":2020},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.481900Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:0465a861323e73198cb4426168559e6644d6bcc310436b4f93cdc0aa18fc8272","observation_id":"1dd5c455-49b2-4a44-8e2a-1748b9c3585a","resolution":{"observed_at":"2026-08-10T15:57:42.956760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.943775Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"a142380b-ed3b-4b3d-b126-8033466bfa1d","year":2020},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.485142Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:721e0c805300ab214a805a37d3b362ab51474f2e7974cacdae68451b3ace9772","observation_id":"3bd2bd73-bb53-465c-89b6-2884422e5375","resolution":{"observed_at":"2026-08-10T15:57:42.947170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.934385Z","title":"Vq-wav2vec: Self-supervised learning of discrete speech representa- tions,","venue":null,"work_id":"f4da11e2-ba5a-4203-a527-4475b6fb368f","year":2020},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.488269Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:c4824c269e4add92b301954b4a93ce9f0367f77d72fb87ae7653a70c68b1fd4a","observation_id":"e402279e-b1bf-43e8-bef5-cb7350c04f9e","resolution":{"observed_at":"2026-08-10T15:57:42.937762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.924885Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":"1b72cc4a-6e73-490d-821b-9996e1dd77fa","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.491568Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:b8096e63ada9add929a8d04c9483b9a9ff3cbe1d5361948aaf2bb9e165649154","observation_id":"707a6783-a8de-41d9-8620-22d4a10e47f9","resolution":{"observed_at":"2026-08-10T15:57:42.928387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.915769Z","title":"Mas- sively multilingual ASR: 50 languages, 1 model, 1 billion parameters,","venue":null,"work_id":"ba103c32-4108-4be3-9efd-01e319f18f91","year":2020},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.494878Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:ece7d27d9f39b6d7df65ae741e0316c1da3ef6480e956b84766d56306a951565","observation_id":"11941234-d00d-4687-9861-fa064edd743b","resolution":{"observed_at":"2026-08-10T15:57:42.919017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.906187Z","title":"A unified system for multilingual speech recognition and language iden- tification,","venue":null,"work_id":"edae34d7-e945-423f-bab8-5380801385d1","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.497963Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:c27c5d1352684f82995ea326b073736196c8c78ac17541b0d97404c1f269881d","observation_id":"9fbab78f-f90a-46b5-b455-35bf4df70dae","resolution":{"observed_at":"2026-08-10T15:57:42.909595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.896579Z","title":"Improving massively multilingual ASR with auxiliary CTC objectives,","venue":null,"work_id":"26eac08e-f0aa-4a18-ab90-cb3e2c4c2a4d","year":2023},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.501086Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:6e3fc6d820bfc9ed3549dde61bee6829b7adf446714a191d1a2f9bf0275157e6","observation_id":"ccdcf5da-8602-45cd-af32-4c192ef53f36","resolution":{"observed_at":"2026-08-10T15:57:42.899936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.887151Z","title":"Layer-wise anal- ysis of a self-supervised speech representation model,","venue":null,"work_id":"70ceab9a-4370-43f3-822f-c450f3855214","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.504404Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:9906662f05d763ad33ab5d64da7031da779d9c79918992cee1a6046006b5d9a5","observation_id":"30542781-2cdd-4cd9-ab7b-5497914f8633","resolution":{"observed_at":"2026-08-10T15:57:42.890668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00387","last_updated":"2021-07-12T22:46:37Z","snapshot_observed_at":"2026-08-16T18:54:42.322126Z","submitted_at":"2021-01-02T06:29:12Z","title":"What all do audio transformer models hear? Probing Acoustic Representations for Language Delivery and its Structure","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00387","snapshot_observed_at":"2026-08-10T15:57:42.507832Z","title":"What all do audio transformer models hear? probing acoustic representations for language delivery and its structure,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.507832Z"},"links":{"cited_paper":"/paper/2101.00387","citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:1d970af99a392a3c787861bcfa8784e03ee8cb1099664899a537d2ffad32bc99","observation_id":"1d506e3c-8735-4ad5-a59d-a7a2205dbe7b","resolution":{"observed_at":"2026-08-10T15:57:42.507832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16937","last_updated":"2024-04-27T13:03:27Z","snapshot_observed_at":"2026-08-16T14:56:39.551933Z","submitted_at":"2023-09-29T02:35:36Z","title":"SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition","version":2},"cited_work":{"arxiv_id":"2309.16937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16937","snapshot_observed_at":"2026-08-10T15:57:42.633504Z","title":"SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition","venue":"cs.CL","work_id":"2e558a3c-b5e4-4b66-8691-1ceb1db2d3a8","year":2023},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.511370Z"},"links":{"cited_paper":"/paper/2309.16937","citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:96d5b1ca201f8c237451097476534b37144e936c57275da2947ff9bb193277aa","observation_id":"5a34dbad-4aef-4360-8984-27414c95cd1b","resolution":{"observed_at":"2026-08-10T15:57:42.639258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.877590Z","title":"Neural discrete representation learning,","venue":null,"work_id":"8af2f71d-f5da-4221-825e-7c789bd29e30","year":2017},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.515280Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:ac8e4167650956dac647be13bbe3b90b2b22f08d38bc7a0049756c6f18a4ade6","observation_id":"ec95d4d8-1ac9-4e50-8b3e-c5c0cfdadd10","resolution":{"observed_at":"2026-08-10T15:57:42.881003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.868267Z","title":"Common V oice: A massively-multilingual speech corpus,","venue":null,"work_id":"99fa1a67-268c-47af-a71b-810fd70f49e4","year":2020},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.518513Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:65641950fc5d6ab35c4f8b097afaad7555a4caa42a79239e1b950fab659a43e1","observation_id":"c89c2a6d-658c-4e50-ba73-e203532bb2f6","resolution":{"observed_at":"2026-08-10T15:57:42.871524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.858790Z","title":"Hubert: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"fd9c5d22-5c6c-4af7-9c72-30d6755b492f","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.521967Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:5b5fccde58de9382822f4b6afaa28b9acc572a4a7b5087b8f2223693b45a3015","observation_id":"89548db9-6d8f-4a8f-908c-cce5f4f08471","resolution":{"observed_at":"2026-08-10T15:57:42.862351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.848940Z","title":"WavLM: Large- scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"21b2ab4d-7478-49d6-bd72-c23851566dcf","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.525096Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:bd17f584d57e2f103109a058c89f9994ce0a28a497783710f7da995f69738e5e","observation_id":"3c5c16d2-f32a-4bee-8996-e6dbf79b4dda","resolution":{"observed_at":"2026-08-10T15:57:42.852920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.839768Z","title":"W2v-BERT: Combining con- trastive learning and masked language modeling for self- supervised speech pre-training,","venue":null,"work_id":"76f3c60f-8afc-4c22-b000-119ac42c2e15","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.528279Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:f09e3980cdd345b772931591b87565f73bc62933f3f12b9e80c36eb1cf27bbb4","observation_id":"2ff3f2c7-ba79-4baf-a7fd-0d9c9e81ba91","resolution":{"observed_at":"2026-08-10T15:57:42.843182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.830359Z","title":"wav2vec: Unsupervised pre-training for speech recog- nition,","venue":null,"work_id":"e66bbb73-8ea4-4b10-828b-4c6b7e62fe5e","year":2019},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.531437Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:b95e68c9cc75cc3053709b994514260d568dca3b63e5857acfea4cfe176cc435","observation_id":"934ba7f0-c682-46a9-864b-fc566ee3f743","resolution":{"observed_at":"2026-08-10T15:57:42.833805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.820696Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"f165faae-fb4f-4825-928e-cfbf943e309f","year":2019},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.534634Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:b3c823d9adb550de4c79495d6905699acbed0cddc32e187d672efcb8fbcf16d8","observation_id":"81844eb0-b01e-4766-b05b-50daee5da045","resolution":{"observed_at":"2026-08-10T15:57:42.824211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.811419Z","title":"Categorical reparame- terization with Gumbel-Softmax,","venue":null,"work_id":"4344184d-ae82-46a9-b72b-34c2f8e0d3a6","year":2016},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.537832Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:6b737cb7714c10d21404b29f2f125b6e7535cf84926dfac165812a609205cf53","observation_id":"9589f659-9c7b-42a8-85af-5180fad9a554","resolution":{"observed_at":"2026-08-10T15:57:42.814760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.802122Z","title":"A* sampling,","venue":null,"work_id":"de984f50-9432-4de5-9a26-f19f4945125e","year":2015},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.540929Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:b487cd4a1512f4e28549851cc9e391d589fdb96c9023efdaecfaf1d11ba2cb5d","observation_id":"64c536b0-978e-4c42-b5b4-29b0f2093e5f","resolution":{"observed_at":"2026-08-10T15:57:42.805461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.792859Z","title":"Joint unsupervised and super- vised training for multi-lingual ASR,","venue":null,"work_id":"e8fc262b-fc47-4716-b783-384b5a333118","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.544200Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:2d94c376872f3c40f08ef4a150a2cd5b8f0b808c8aaaa8d7bcc69df951e868f9","observation_id":"faa320a7-cb69-4e79-a8bd-ef58a5320f42","resolution":{"observed_at":"2026-08-10T15:57:42.796208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.783473Z","title":"Cross-lingual self-training to learn multi-lingual representation for low-resource speech recognition,","venue":null,"work_id":"68fbd0e4-fecb-4d1e-ab11-20c05d7e8880","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.547811Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:d253a9322581a98102ad1469e3a88b25e6ca2dd52d84f3ab4ffd55089c2e1c01","observation_id":"52c33285-d58e-43fc-9647-6fe0ca18517e","resolution":{"observed_at":"2026-08-10T15:57:42.786948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.773771Z","title":"Attention is all you need,","venue":null,"work_id":"4d616b20-d189-46bf-a08f-31170b61bae5","year":2017},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.550894Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:a338cf3cd7563feb3c2d33cfda08d115642c9a73a736c89e046c559ddd6be764","observation_id":"eb84b64b-3d5b-49f2-b195-c0ad7aa8b999","resolution":{"observed_at":"2026-08-10T15:57:42.777155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.764518Z","title":"Connectionist temporal classification: labelling unseg- mented sequence data with recurrent neural networks,","venue":null,"work_id":"321616d9-e291-478b-8d21-d6857867299c","year":2006},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.554122Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:f8fc1812db362c126ef5c2e95cdf0bf6dadd80e81ffed83fed69f33ab9e18af2","observation_id":"01c1387a-4e48-4bcf-8d00-cdc8365e8358","resolution":{"observed_at":"2026-08-10T15:57:42.767993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.755211Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"8a163818-a3a3-42e3-99dc-288bc7d4930d","year":2012},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.557216Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:85947d3ece060ae1e93496cb8fc742089748d4a3a89d5bc2d5eaeb0e9bef71a1","observation_id":"b2b594aa-7869-4f97-ab40-dc9da1c7e498","resolution":{"observed_at":"2026-08-10T15:57:42.758559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.744763Z","title":"Exploring wav2vec 2.0 on speaker verification and language identification,","venue":null,"work_id":"a0361a5e-c2d7-4b27-bc65-85c23678eac0","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.560411Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:3b7d32200555c68ca3e7365329624742cccea55d4ef11a262f8bfb5bbff28c21","observation_id":"2d903276-2441-4c58-bed6-0e420676a7c0","resolution":{"observed_at":"2026-08-10T15:57:42.748247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.734927Z","title":"Non-contrastive self-supervised learning for utterance- level information extraction from speech,","venue":null,"work_id":"a404da1d-873b-4dfb-8c04-0b692a174d51","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.563681Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:c9c26971c29f10bea9989109cffc57e1b6ec120b5e3f2633e3734210ad0c4f56","observation_id":"3096c2af-3bfa-4c54-b865-d02d525a6a93","resolution":{"observed_at":"2026-08-10T15:57:42.738482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.725521Z","title":"Unispeech-sat: Uni- versal speech representation learning with speaker aware pre-training,","venue":null,"work_id":"2accc5c9-af04-4c78-9a85-3bcc1f0de663","year":2022},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.566920Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:60ad54531fc39f912cdd898bea2fb8cf0f144746d4240897305d3f092e186f47","observation_id":"f1f2d725-31e2-4991-9735-698279184ec8","resolution":{"observed_at":"2026-08-10T15:57:42.728961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.715677Z","title":"Trinet: stabilizing self-supervised learning from complete or slow collapse,","venue":null,"work_id":"3c336b95-6fee-49f1-ab9a-8cca6bc2f6f3","year":2023},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.570170Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:8833d856daddd1e9cfb909681aff323ec73b9f934852dfb412fd2bf31402721a","observation_id":"f0b75b26-219d-40de-a6ef-e9a5278ee4da","resolution":{"observed_at":"2026-08-10T15:57:42.719210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08022","last_updated":"2017-11-06T14:21:43Z","snapshot_observed_at":"2026-08-15T14:21:42.814056Z","submitted_at":"2016-07-27T10:23:00Z","title":"Instance Normalization: The Missing Ingredient for Fast Stylization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08022","snapshot_observed_at":"2026-08-10T15:57:42.573440Z","title":"Instance nor- malization: The missing ingredient for fast stylization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.573440Z"},"links":{"cited_paper":"/paper/1607.08022","citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:639e0acbe71a1bd9213e30314b05b759ad76a203e8ba2930a433c06cd2474116","observation_id":"585fbd0d-601d-4791-9187-bbd8dd544226","resolution":{"observed_at":"2026-08-10T15:57:42.573440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.705174Z","title":"Goodfellow, Y","venue":null,"work_id":"6f486454-4381-41cf-8819-a1dd3070176c","year":2016},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.577701Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:b2f7fc023bdac8f18029b2e3679c6ae326a98ecd83d4b9aa9560f88d79a37304","observation_id":"98244585-84b0-424b-8f93-6a48133dbd2e","resolution":{"observed_at":"2026-08-10T15:57:42.708985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.694565Z","title":"Product quanti- zation for nearest neighbor search,","venue":null,"work_id":"e0c06e5c-3dc1-4ec1-a9cb-6dc78990a3cb","year":2010},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.580740Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:d48b7d7cc7ea7664336bd1c87b665e46b52bcc0692835fb083eb82a94c6e8f24","observation_id":"6e4242c0-1cbc-45f0-95fd-fbe6c2e3e77f","resolution":{"observed_at":"2026-08-10T15:57:42.698215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.685007Z","title":"Exploring simple siamese rep- resentation learning,","venue":null,"work_id":"b9d02b1c-059c-4538-8f2a-9d46e7d54ffd","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.583851Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:133be2387488f628ee01c50345a02eaf401b02e9a67f6fa621a3b5e0782086cc","observation_id":"891056d3-950d-4e1b-9296-97d49579a590","resolution":{"observed_at":"2026-08-10T15:57:42.688329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.675210Z","title":"Fairseq: A fast, extensible toolkit for sequence modeling,","venue":null,"work_id":"a6bf53c4-1f21-4a24-b58a-0cb0ee5a9f4c","year":2019},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.587115Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:7ede17e42240ce9d1cb172a6271809a9bc59eb876ad0471d6837cb401d404647","observation_id":"dff6aa5b-3646-48e9-ba17-f2d19aa90203","resolution":{"observed_at":"2026-08-10T15:57:42.678726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.665493Z","title":"Adam: A method for stochas- tic optimization,","venue":null,"work_id":"2e756662-048f-4263-9147-5f37b154bde2","year":2015},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.590233Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:05a3c2be5c3e83296e990e3cd42c7700bd2367f2c12d59de7fdec059a2f73876","observation_id":"c6bcdaba-0bb0-4d52-bd6b-5877f290d375","resolution":{"observed_at":"2026-08-10T15:57:42.668826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:57:42.655577Z","title":"Unsupervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"5f609d9a-e3bc-439d-9d26-da90407d01ed","year":2021},"citing_paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T15:57:42.593345Z"},"links":{"citing_paper":"/paper/2501.13497"},"observation_digest":"sha256:655cc65392caf730860616f4e7d8ba4266f9811c0405414966bcae5691c0f03d","observation_id":"f1b0d0ea-25be-408d-93b6-2d7e82c8b11a","resolution":{"observed_at":"2026-08-10T15:57:42.659087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.13497","last_updated":"2025-01-23T09:25:31Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T14:24:11.716152Z","submitted_at":"2025-01-23T09:25:31Z","title":"DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2501.13497."}