{"as_of":"2026-08-16T04:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8a8301e472e58dfe42b33a2f3935061601a39f4cf0adadf834152f9ca38cd63","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:45:19.259324Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:45:15.046428Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:45:19.754847Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"cited_work":{"arxiv_id":"2505.21138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21138","snapshot_observed_at":"2026-08-07T13:45:19.754847Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","venue":"cs.CL","work_id":"f889ee5e-7643-4fbc-b1d7-8d0b2c808a1f","year":2025},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.046428Z"},"links":{"cited_paper":"/paper/2505.21138","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:67fc34cc6597aec42475091ed0fa9acb0b19c8d99f65d5c4b4457cf6d8c05989","observation_id":"be2f8af5-9fd0-4e22-97c0-cc8d2b6f8bb1","resolution":{"observed_at":"2026-08-07T13:45:19.813267Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21138/citation-record","integrity":"/paper/2505.21138/integrity","json":"/paper/2505.21138/citation-record.json","paper":"/paper/2505.21138"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"cited_work":{"arxiv_id":"2505.21138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21138","snapshot_observed_at":"2026-08-07T13:45:19.754847Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","venue":"cs.CL","work_id":"f889ee5e-7643-4fbc-b1d7-8d0b2c808a1f","year":2025},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.046428Z"},"links":{"cited_paper":"/paper/2505.21138","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:67fc34cc6597aec42475091ed0fa9acb0b19c8d99f65d5c4b4457cf6d8c05989","observation_id":"be2f8af5-9fd0-4e22-97c0-cc8d2b6f8bb1","resolution":{"observed_at":"2026-08-07T13:45:19.813267Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:23.124571Z","title":null,"venue":null,"work_id":"b3419f97-efe0-4279-9eaf-c69401bae7a3","year":null},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.112477Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:6e0019e93be3c0cb9e985770ee7ae4da5a861f8450e1a185b5d8ba47b4976494","observation_id":"68bb04c9-6921-4b33-b68a-035357bc124a","resolution":{"observed_at":"2026-08-07T13:45:23.181410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:23.009415Z","title":null,"venue":null,"work_id":"0ed8e776-cdab-419f-9728-e37608fd239b","year":null},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.195710Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:b037b8599a0e5a132c8458c5b274a4f4433d98789796389dc35eed508ec226cd","observation_id":"6a06f114-ae7c-4d4f-a6d2-b34206c7dbd1","resolution":{"observed_at":"2026-08-07T13:45:23.064921Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9714.5811","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:19.624523Z","title":"Comparison of Projector Architectures We evaluate the effectiveness of different projection layers through small-scale experiments","venue":null,"work_id":"80f9d6af-a2c6-4c4f-8e6a-cc1d2d2fb644","year":null},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.392299Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:0d85ff4ccf4a47539e23c6b8137bb122e06622357deeec4d49680fe2c323fd9b","observation_id":"022ce5b0-9b80-4aaf-8976-9e10d90ce784","resolution":{"observed_at":"2026-08-07T13:45:19.680701Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.599610Z","title":"For the encoder, we employ Data2Vec2, pre-trained on 300,000 hours of unlabeled dialect and accented speech data","venue":null,"work_id":"ebf63a26-c1de-4fdc-a975-d57c2dce5111","year":null},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.641318Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:5ce7fd51e50999b81bba8d74a532704339835dede67d14746b3e289be6d5e4d6","observation_id":"3fd8d8ed-cbbf-4ac3-846a-c99f239000cf","resolution":{"observed_at":"2026-08-07T13:45:22.644271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:16.814667Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:16.814667Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:93383e7ef9860eb793f289d013342f507b78e681d01ca8757dec3df78071f67e","observation_id":"8481c00f-ee4f-4bd6-92ad-ce72ff14ed28","resolution":{"observed_at":"2026-08-07T13:45:16.814667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.328373Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit,","venue":null,"work_id":"59a21567-95d1-48e4-be27-3b9a6dd27946","year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.417541Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:c703569cd36ed4f02bd844fa8945e9999c85107dac2be3102c69f1dbe25b543f","observation_id":"2bb44d2a-b5a4-476f-861b-2dbaced32437","resolution":{"observed_at":"2026-08-07T13:45:22.383789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:15.733460Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.733460Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:11ba04196a7dbc06766b0aacd6abe461c303e369de61393598589a0e49636d15","observation_id":"eb57100b-7a45-4f87-9d32-bc852ae07b0b","resolution":{"observed_at":"2026-08-07T13:45:15.733460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-13T12:33:46.085209Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T13:45:15.871141Z","title":"Google usm: Scaling auto- matic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.871141Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:b9d16126e813c86ce9f55cb9419ae8305f36ce1e36a2042847fc040ded0f8536","observation_id":"5aa3de75-d092-4a8b-b414-25c96d26b77d","resolution":{"observed_at":"2026-08-07T13:45:15.871141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:15.979645Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.979645Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:51dfceec00bc467d42ecb3cc4d8195f8bef1daef920d0b6b9431e43a8e0718f9","observation_id":"d9a3c4c8-5151-4605-bfba-2b57057dfd21","resolution":{"observed_at":"2026-08-07T13:45:15.979645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:16.086548Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:16.086548Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:81ab9e366697ac31cf4285e0ab0624611152cf74c9c0cfaf3458028fc0d3ecea","observation_id":"cdcd4962-ea7b-47bc-a4f9-e667149a400a","resolution":{"observed_at":"2026-08-07T13:45:16.086548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.471002Z","title":"WeNet 2.0: More Productive End- to-End Speech Recognition Toolkit,","venue":null,"work_id":"8f9ccfde-505c-40a6-98b8-d7f4f7926d80","year":2022},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:16.323423Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:73f89254b177826ab48d56d25137098d8f20624e986e320ebec9c404a78d2656","observation_id":"7cf59c1a-c633-4c9a-9398-c5e63dc9fa20","resolution":{"observed_at":"2026-08-07T13:45:22.507598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.958095Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"5153a9b0-5440-40e5-90db-20e8f938198a","year":2021},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.991554Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:0788d95e6b9ae12031654d341fbaac0a3dc9988acfe924af8739356d8750751b","observation_id":"ddac4a9b-b1b5-4d92-a616-0ec24641fa9e","resolution":{"observed_at":"2026-08-07T13:45:22.032796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.827303Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"b0c43bcd-c03d-48c8-a117-9695992b86a7","year":2022},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.043107Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:ac9ebcb6e4754f36d28cd419703733b0dd44a308438702e4225a957ce8b14385","observation_id":"6feb6cd0-1b91-4d2a-ae45-6765904353d9","resolution":{"observed_at":"2026-08-07T13:45:21.877417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.224213Z","title":"Gpt-3: Its nature, scope, limits, and consequences,","venue":null,"work_id":"af9fd198-3dbb-42f5-953b-0c9576e1d596","year":2020},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.526390Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:cde6583f2644b581a3898c0678d0b64307b783bc0372e159d163fd4952d20eed","observation_id":"c6ace46f-5c53-421d-9584-04108fb150d8","resolution":{"observed_at":"2026-08-07T13:45:22.277132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:45:17.564669Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.564669Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:b9202a1787d22bf0b5853181fe62361aaa10825a5e328b8ffca22ad1ca79d8a3","observation_id":"837f96f9-75ae-446f-b604-43ee8a776170","resolution":{"observed_at":"2026-08-07T13:45:17.564669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.106510Z","title":"GPT-4 Technical Report,","venue":null,"work_id":"c1b34dae-ce99-41f7-b789-a2df88b28298","year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.640770Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:e7e73da1d47ad7ef1b8bf817cbfab08e06356e785827b022bab74521d91312b9","observation_id":"da5ae49d-881c-4b24-9167-04ee078dd221","resolution":{"observed_at":"2026-08-07T13:45:22.162195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T13:45:17.750266Z","title":"Gemini 1.5: Un- locking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.750266Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:46ccdfb18cd55112c6d7288baad9233543d758a02784ea94f2a21c58441381f5","observation_id":"127a1f90-fb97-4eeb-96c7-4f0727596302","resolution":{"observed_at":"2026-08-07T13:45:17.750266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:17.875746Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:17.875746Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:5b5275986dbf218c4872348751ead1058c8122b635bebbba7e07b3bda1230eed","observation_id":"a44d2d83-e3e7-45c9-9599-bd49d8462d16","resolution":{"observed_at":"2026-08-07T13:45:17.875746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.525357Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models,","venue":null,"work_id":"d3581af8-a4fd-4743-9aa0-2a569a89eb2d","year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.390855Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:c9e68c8001f67819e3555e59abc0db20c738b91f5d3f29c4b615fa9f0293cd2f","observation_id":"e2b84c9e-3a63-4c65-abe9-bb9003bdeb7a","resolution":{"observed_at":"2026-08-07T13:45:21.588767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.363799Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity,","venue":null,"work_id":"0298dca5-91db-4742-9cde-22010593fd29","year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.457517Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:8ffc799b8d536f4ef49fc86fb98a40ba470867eef55c6a0fbaa3099998e9953a","observation_id":"0b967a9e-e2ff-4f9b-b058-7bc03bc552e6","resolution":{"observed_at":"2026-08-07T13:45:21.434722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:18.104596Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.104596Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:f75d63ceb7cf1050013a5fb598a419a56119df492c2d2aa2b54ee7c81d46887f","observation_id":"c443ee92-6391-4879-a12b-0dd6be219cf4","resolution":{"observed_at":"2026-08-07T13:45:18.104596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.699223Z","title":"Leveraging large language models for exploiting asr uncer- tainty,","venue":null,"work_id":"a37e0da0-10cb-4a53-911e-74d1db4bf153","year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.158527Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:528a257515b67574cf9f430537c1b9503cdf9da722f10406c81f4d206c88b1d7","observation_id":"4887a9c0-72d9-4a75-b0a1-e439270cfc36","resolution":{"observed_at":"2026-08-07T13:45:21.751003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04172","last_updated":"2023-09-29T07:32:03Z","snapshot_observed_at":"2026-08-14T02:27:46.713494Z","submitted_at":"2023-07-09T13:38:25Z","title":"Can Generative Large Language Models Perform ASR Error Correction?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04172","snapshot_observed_at":"2026-08-07T13:45:18.234276Z","title":"Can gener- ative large language models perform asr error correction?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.234276Z"},"links":{"cited_paper":"/paper/2307.04172","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:ca343e131514dfcca799f5c495ac3cb6153372b53195ae87a734755b29cae544","observation_id":"65d8ca03-48b5-499a-a033-3562f9bc9b44","resolution":{"observed_at":"2026-08-07T13:45:18.234276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03152","last_updated":"2024-05-06T04:05:19Z","snapshot_observed_at":"2026-08-15T14:55:11.544821Z","submitted_at":"2024-05-06T04:05:19Z","title":"MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03152","snapshot_observed_at":"2026-08-07T13:45:18.291161Z","title":"Mmger: Multi-modal and multi-granularity generative error correction with llm for joint accent and speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.291161Z"},"links":{"cited_paper":"/paper/2405.03152","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:fb226f8587393b12f518cc9fdd8d1bc2a63e825878e74a2ed1debc0c06c39cc9","observation_id":"e01d0042-4c78-4aab-9676-377ef9db2be8","resolution":{"observed_at":"2026-08-07T13:45:18.291161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:18.344386Z","title":"Kespeech: An open source speech dataset of mandarin and its eight subdialects,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.344386Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:7076da835581eadcc544654a9875bf9ea7367553def826087219347ebf75acf0","observation_id":"2b19b00f-8829-46ed-b7b4-22bf93a50ad4","resolution":{"observed_at":"2026-08-07T13:45:18.344386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.671679Z","title":"AISHELL-1: An open-source Mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"a558afa5-8cb0-420d-a54b-8aec25256c8c","year":2017},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.811917Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:3726fda824d11eed8168a6b9bff4b7ebb6822a9c5fec420ebe9e754adcf7b68a","observation_id":"cf602bb8-6d7f-4cbe-8291-7890086d3f75","resolution":{"observed_at":"2026-08-07T13:45:20.727866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:45:18.861431Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.861431Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:e268d5e6656eac7ebbb61827f0c26e601760cce34a799f9eff4a4374eedb28f6","observation_id":"13b96e97-e6ec-4274-8db7-e12b36132b3b","resolution":{"observed_at":"2026-08-07T13:45:18.861431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.238665Z","title":"Qwen-Audio: Advancing Universal Audio Understand- ing via Unified Large-Scale Audio-Language Models,","venue":null,"work_id":"1bc7f7e8-a2d3-4fb8-a399-97be65a66cbf","year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.503964Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:b8e59ac21adb205126d99b0ee837eda0800e5291e3d746aa1da30460bbf0d8bc","observation_id":"bbff2d03-474f-459b-8d98-60d1fda0ff5b","resolution":{"observed_at":"2026-08-07T13:45:21.285264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:21.082766Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"73ab0458-fd65-4e8c-8d47-834cbe160870","year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.546693Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:97e42dd6382cff7d0a1a550c78a84d2d99f8bfecd2389bd27addd6919c966872","observation_id":"f42c58a3-cc26-4ab0-bcff-d2c2d5fa54b9","resolution":{"observed_at":"2026-08-07T13:45:21.158546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T13:45:18.621065Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.621065Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:3ae86ac58605dfb33ceea5d1518444d3d233461dcd29df533802ba0a3def9f2f","observation_id":"3695d0f6-299d-4d13-b43d-0ad63a1575ca","resolution":{"observed_at":"2026-08-07T13:45:18.621065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.948333Z","title":"Unveiling the potential of llm-based asr on chinese open-source datasets,","venue":null,"work_id":"a313a4e9-a2e8-4e62-80fe-4a37e6f0a574","year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.673028Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:a7b9c40eb53d6d45bb4c597e9e11e48148e27a77e98ce8ebdf9405690bdc1304","observation_id":"324bff1a-c214-4bd9-86d8-f4e6b34e9470","resolution":{"observed_at":"2026-08-07T13:45:21.025596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.836251Z","title":"WENETSPEECH: A 10000+ Hours Multi-Domain Mandarin Corpus for Speech Recognition,","venue":null,"work_id":"142204fb-e748-4b13-9252-00a2603075a8","year":2022},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.736382Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:e3aec1e2f44a93366e1cf9509900a1eb9ddd9fb535101c5200d24b3199a611e1","observation_id":"5180bec7-511a-4a39-a479-48ddca99f3e1","resolution":{"observed_at":"2026-08-07T13:45:20.876390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:19.905683Z","title":"Why Gradient Clip- ping Accelerates Training: A Theoretical Justification for Adap- tivity,","venue":null,"work_id":"a15d925d-4405-4f4e-b821-94d8d32021ca","year":2020},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:19.207858Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:d98c790880566b5ace844bb5372b587bd843900729bec49c9f92a4a45b035af3","observation_id":"688c2a28-a44b-4a5c-b59c-9e509b07c082","resolution":{"observed_at":"2026-08-07T13:45:19.937172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:19.259324Z","title":"LoRA: Low-Rank Adaptation of Large Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:19.259324Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:5430bd008b97e6ff11ba4a0aad3594c7ddddcd9eb814beab9c9c036ee6d9c8bb","observation_id":"40d71125-3c70-4c54-ba84-d1b4db577188","resolution":{"observed_at":"2026-08-07T13:45:19.259324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.508423Z","title":"Tele- speechpt: Large-scale chinese multi-dialect and multi-accent speech pre-training,","venue":null,"work_id":"5d3b050a-3342-455b-9f86-f4e90d9aee5f","year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.916120Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:2d1c3a5f71f82dc9d7d97791003ecba4a174d81cdbed5f18e87f3c2141f71327","observation_id":"a455f803-08c6-4069-b4a2-5c9dad28b553","resolution":{"observed_at":"2026-08-07T13:45:20.589344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.318570Z","title":"Self-supervised learning with random-projection quantizer for speech recogni- tion,","venue":null,"work_id":"140d173c-e180-4eba-9698-b10975700e4a","year":2022},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:18.972516Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:2cb2209b3a1d9a34b25de9c9ab1be93efd078e0f813f78e960c78dd403a0ca3b","observation_id":"52f0cbdb-4535-4bd9-aa5b-a0c5d249db96","resolution":{"observed_at":"2026-08-07T13:45:20.411187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.177217Z","title":"Di- nosr: Self-distillation and online clustering for self-supervised speech representation learning,","venue":null,"work_id":"2b7a8f21-7b23-464f-acbc-e4db4873790f","year":2023},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:19.024654Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:3f383b85e4f980bee8dabda3bad5ae34474ab6c1ebca43e727cd14d70c82f12d","observation_id":"2ecadf1c-0ca9-4529-b9a8-b370b758bc8b","resolution":{"observed_at":"2026-08-07T13:45:20.245452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:19.060669Z","title":"Connecting speech encoder and large language model for asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:19.060669Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:2419f542dfa2545358680ca896358d1432c4f4bd27324168b4102536041f1bd7","observation_id":"2cb9c4df-bbde-4824-aa06-9466f3fdc5ee","resolution":{"observed_at":"2026-08-07T13:45:19.060669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:20.004124Z","title":"Decoupled Weight Decay Regular- ization,","venue":null,"work_id":"446e8d6e-53cb-4974-aae2-a3555d44f17f","year":2019},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:19.143324Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:bc13e67f6ef1d7c3ab612004db645fd3016bda2c32785ef0d21e5b9f1c02ea84","observation_id":"4849042a-9d3d-4c86-8198-726b2158e300","resolution":{"observed_at":"2026-08-07T13:45:20.067738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.717981Z","title":"However, lower down-sampling rates also increase the computational load on the LLM, requiring more resources during both training and in- ference","venue":null,"work_id":"82e95b5d-e822-428e-8b25-ed6d66dbcd91","year":null},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.530613Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:3b2481cd33788a32ef33e6a740ed44393ab7f0df21a63beadc2a01145351785e","observation_id":"a30bf01b-67fc-451e-82f2-1ff2a334620a","resolution":{"observed_at":"2026-08-07T13:45:22.810482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:45:22.898978Z","title":"We configure LoRA with alpha = 32, rank = 12","venue":null,"work_id":"326d77cb-90c0-4eda-8228-3f40e2dde491","year":null},"citing_paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:15.288194Z"},"links":{"citing_paper":"/paper/2505.21138"},"observation_digest":"sha256:8d48961cf6716a12929ccc6e53bf92fb5ae33ae32a274febe8bdcbe431803c26","observation_id":"b0cd60e2-9d25-4963-a81e-8ed57ee145ff","resolution":{"observed_at":"2026-08-07T13:45:22.947544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21138","last_updated":"2025-06-16T07:57:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T09:31:30.430098Z","submitted_at":"2025-05-27T12:50:55Z","title":"Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2505.21138."}