基于图的嘈杂自动语音识别语音错误纠正
尽管自动语音识别(ASR)系统整体词错误率较低,但仍存在影响语义关键标记(如命名实体、否定词和情感词)的残余词汇错误。这些错误往往具有结构性,源于语音相似性而非随机噪声,使得简单的逐词纠正不足。本文提出G-SPIN框架,结合语音图建模与上下文语言理解,通过图神经网络构建语音邻近候选词,再由掩码语言模型进行局部上下文评分,最后由指令调优的大型语言模型对候选集进行上下文感知重排序,提高纠正准确度。该框架轻量、模块化,完全在推理阶段运行。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。