面向米佐语自动语音识别的语音语料库:基于形态学感知评估的Whisper与SraVaani 1.0微调
本研究开发了面向低资源语言米佐语的自动语音识别(ASR)系统,收集和整理了17.62小时的语音数据,分别基于三种Whisper多语言模型及SraVaani 1.0印度多语言模型进行了微调。Whisper-large-v3在传统字错误率(WER)中取得最低18.08%的成绩,在形态学感知评估中WER更低至7.22%。SraVaani 1.0的零样本评估WER为58.27%,而经过针对米佐语言的微调后,传统WER降至29.45%,形态学感知WER降至17.93%。结果显示Whisper模型即使面对未见过的语言也能表现出显著低的错误率,且通过微调提升多语言模型性能效果明显。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。