{"as_of":"2026-08-21T12:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13425cf266130bb0babbb52c7af15dbe898cbdf8231eac35aee2d0a895cc891f","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T11:50:03.947364Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.10864/citation-record","integrity":"/paper/2606.10864/integrity","json":"/paper/2606.10864/citation-record.json","paper":"/paper/2606.10864"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Hybrid CTC/Attention architecture for end-to- end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:6de410037b11ce5bd0a2873c069985f92458fd08c22ab7a278dd5fda99a7b391","observation_id":"d1b14169-4b35-4c45-8544-e5f89945c72f","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:e5405a9f715c87607f125e4c2fe44c7f37be7b3bf0074c42f71849875427eee4","observation_id":"6b01d563-b780-4530-b8d2-e70c5c4481db","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Reproducing Whisper-style training using an open- source toolkit and publicly available data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:ac64de9fcb071961be33aeda1e89fc2137cd287096a631e6759f20c832ef62bb","observation_id":"e1db1406-605b-43c8-a94d-8a2c6faa10cd","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:3bce15b645c5e643023452b3b27d734abc684af80e069f7e064e0a558687acac","observation_id":"669d07a2-23b5-487f-ad7d-b8b78af9ab28","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:fc7eaa3b461f594887fc9bd674c5c233620d0a0064366eaae05bfcc3b18fc298","observation_id":"986f3fd8-9c41-46e4-9dbb-f71a4806f83d","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:e62f8f7f012c9d87108bb3de3dedcb51165320ed1573bdefcd73ab84c8f05e05","observation_id":"04e42d85-8d14-46d5-bd4a-9f700843e86b","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"ICLEval: Evaluating in-context learning ability of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:217d7035a5096e4700fd6e7cfd959a3c4716edfaffec727ca11c7ad21a5cf87e","observation_id":"992fab96-0548-4444-932c-5eac8b18f3ab","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"AudioChatLlama: Towards general-purpose speech abilities for LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:1ca2568eead1aeafbe0f95de677eb688bfef71eda7f22d8b7131f5eb0034f76e","observation_id":"1b6710c4-8ada-4492-82e0-4abca001297a","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:e3c4d25acff63e579ff5d29a922297efc88170cc8e73166b17affe492d073f1f","observation_id":"9a2f510a-899c-42b2-a92a-38338f8b3f75","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:78406096ea4cea1b36af97c63b439154925cdb299112a7b68c3ecc594f9c677a","observation_id":"ddf5143e-c500-4292-ac28-174acafe8bff","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"On decoder-only architecture for speech-to-text and large language model integration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:9877da50d1490b64a84809524222529ac2a174e85ae1aae0ab254769b591d01d","observation_id":"53be9f38-2b91-475f-b8bc-f9a32fcf2d5a","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:0af946bf8f09a9d360fa145e0a00bf275cd036ec7e04b0a5cb772f12119dffde","observation_id":"e5656288-7fba-4200-8c70-4f65b25316db","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Speech ReaLLM: Real-time speech recognition with multimodal language models by teaching the flow of time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:6cbb94c05700f8314ecdae20ad5b2ee4f3735306a436743886811733e58f579f","observation_id":"0b8865ce-2074-48db-8f6e-c578995019b6","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SALM: Speech-augmented language model with in-context learning for speech recognition and translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:67189a73c6672eeaf4ae6cd5ae8a2946e1480bc692ba7a0fba249af02a3fe2e3","observation_id":"09d58f6b-d535-4145-87bc-754bb56ae523","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Investigating decoder-only large language models for speech-to-text translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:cf3fb0fd5f5543781a54a4b3401cfe7f100706fbdd2db01f9eb89a50ef8e9b81","observation_id":"93153887-f10e-4eb3-8b8e-95ff650fa62e","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Prompting large language models with audio for general-purpose speech summarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:078863b7a067b2989fa400866759991da864f9ecc8425f1e749526b766f2fcd6","observation_id":"7e5de177-0799-46ec-a724-2e35eb519400","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Contextual biasing speech recognition in speech- enhanced large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:9d3bf31d4c2f01d9db499740ac438455d032caef49bf489e81e26d5d7a5e0be6","observation_id":"df4b2ca7-7ecd-4176-ad0d-0b21386aaf62","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"MaLa-ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:ea3cb2d418f3888427c26f48f385e95261ec24fa7f65ff8dc340e19b8904dce3","observation_id":"36704c65-2420-4a0c-a8cb-ec950f86c00f","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:a90969d56ceac301cd905bb206234b75eff9690c3019aec13cf9ea661bf9cda2","observation_id":"a54408b2-a99b-4b86-a9e1-2c66c8191eb1","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Using large language model for end-to-end Chinese ASR and NER,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:a9ef01a37fa56e75107503de3211472d4bde8cdf0c8bccb7180f2a11e6ffd9f8","observation_id":"284b0de5-918a-404f-9c31-6d890f22f798","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Whispering LLaMA: A cross-modal generative error correction framework for speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:3fa8db0742ed17cd004e9b75c05265606f1f3472e758bd951c17b9f9892b19a8","observation_id":"83509249-a515-4525-b1cf-39a88a4c44f4","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SLM: Bridge the thin gap between speech and text foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:52f9665a190b77cd00f10088cbc74ba15f3031a986db77d84c9052f8e1909ae8","observation_id":"308dcc7e-753a-4e69-9279-90908678973a","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Connecting speech encoder and large language model for ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:ebf6ccb8620223a7fed744aea14e9ba80848f0cf0a4df120c42d7c9890991213","observation_id":"0ef9b052-c03a-4603-bc7b-067531d782cd","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Speech recognition meets large language model: Benchmarking, models, and exploration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:21ca27c1eeab737cd3ba520c4fd8b1f6a09ee09b3896f131fc02061709ef7b9e","observation_id":"8104caaf-e607-4bbb-bff9-2edd8952fe6c","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Improving spoken language modeling with phoneme classification: A simple fine-tuning approach,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:4e85fac46efb82f4bd036e4c532d5ade38006f840e92accb3bac4ef6cd45a8aa","observation_id":"2118fe69-6661-4f4f-b71d-3f4584908b88","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Improving large-scale deep biasing with phoneme features and text-only data in streaming transducer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:bff5f6dec2da0030651572e1f1ec7338504290bd21fec7f0790cd686108199aa","observation_id":"cd7db311-2d99-4413-ae0a-4b4b24da9145","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Phoneme-aware encoding for prefix-tree-based contextual asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:bea72d12bc8433984ebe3f59d78cf197d6b4190c2a3166e327cdbc23c50376dc","observation_id":"6297b633-bdeb-4f11-8f8a-7d709a229f9b","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:317a040a53e9f8c7390ac74ca86e112eb4ee0d359645093cfed22922a71d4de9","observation_id":"cf51188d-07bb-454e-b1ee-08920e00827c","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"AlignFormer: Modality matching can achieve better zero-shot instruction-following speech-LLM,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:39c7cd3b9570ff196284599606378d08897d0933aac9839b7d17a803e4b8e3dc","observation_id":"bbc33d70-9477-4bdd-915f-5130d293ceef","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"QLoRA: Efficient finetuning of quantized LLMs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:555b44f6fb3b36d8dc1fdf1138e3ec21c689c11820f4e795b31cd1b7051e51a9","observation_id":"ab3def8d-3cf8-419b-8428-2fee0b2640fe","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:fb93f7f9e6e441b9f1bbc77d01f81e4ee1e75d6cf43fce887f0969582a5e95aa","observation_id":"f33e143b-118a-4a18-a01b-8699a69ff287","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"TED-LIUM 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:d3d5a4112852c764034d5abcf46b4bf37b7ed379850ef859cfc58b96f6a4fb36","observation_id":"824d3fce-3840-4767-a90b-3331137371d9","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"TED-LIUM: an automatic speech recognition dedicated corpus,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:7c88339365e7dd93aa71a8630d610b3da9cca13d0d01c17c93d5657709c80534","observation_id":"58fa854f-d45e-42d8-bd71-f1277dff0ee1","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:4161580c4c80d0ea2593816dba0cfbed73b9810abc059c978094c79d0e0975f7","observation_id":"1978b4ab-abaf-4dca-902c-bbdbccba3c10","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"SUPERB: Speech processing universal PERfor- mance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:216e173e4bb05591fb1f32b00de6c1aeb3e8062e8787de2bf9f41bae667e4e86","observation_id":"15f6a2eb-8be1-4f7e-ad30-5e48f197f1a6","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"The Spoken Dutch Corpus: Overview and first evaluation,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:8e4c9f5fb29ccaa01e2130bec9fd7c0cad216af06c62f2038fb32e00ee50d32a","observation_id":"a4d18cae-9b84-4b3c-aad9-0b18a3a40c0d","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Automatic generation of phonetic transcriptions for large speech corpora,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:be115b0cdbcc6c7f5437637085a41d27c72cd468e9336fa01f30026b4f339ab5","observation_id":"b79553a2-623e-482b-838a-fe44156eeb26","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Assessing manually corrected broad phonetic transcriptions in the spoken Dutch corpus,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:0ea9f16307652a364cf27f45c266345ac7655290c8408976a868ee34efe2ccb7","observation_id":"28860d14-9775-4695-8545-8b7daa61a088","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03212","last_updated":"2025-02-05T14:26:58Z","snapshot_observed_at":"2026-08-12T03:57:48.700278Z","submitted_at":"2025-02-05T14:26:58Z","title":"Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling","version":1},"cited_work":{"arxiv_id":"2502.03212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03212","snapshot_observed_at":"2026-07-03T07:47:44.604777Z","title":"Leveraging broadcast media subtitle transcripts for automatic speech recognition and subtitling,","venue":null,"work_id":"00d5cc56-1399-40cf-9ea8-c32366104f46","year":2025},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"cited_paper":"/paper/2502.03212","citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:689f27633f84de51286b541f4bd46425709453932458c2e6be8ef729233a8184","observation_id":"1689d178-78d0-42b0-b4b4-48f29e61a808","resolution":{"observed_at":"2026-07-03T07:47:44.606826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:9e0394d12bb64a063fa37f05c2d1d30138e10d0bd5ea3987594a5e3390c1ead7","observation_id":"0fc1c09f-bcf6-4dd7-926b-0975430163ce","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T11:50:03.947364Z","title":"Montreal Forced Aligner: Trainable text- speech alignment using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T11:50:03.947364Z"},"links":{"citing_paper":"/paper/2606.10864"},"observation_digest":"sha256:990122846ba83981afec1cbeb16ac48f1bf64772af0e5cef85eb1274545b5ce2","observation_id":"2e9ebee1-5cad-42cd-8cab-f9446785a2fe","resolution":{"observed_at":"2026-06-27T11:50:03.947364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10864","last_updated":"2026-06-09T13:43:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T23:20:24.726565Z","submitted_at":"2026-06-09T13:43:30Z","title":"Phoneme-First Prediction for LLM-Based Speech Recognition"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2606.10864."}