基于模型的海量多语言平行数据质量评估
本文针对大规模多语言双语语料中存在的非平行句对和低质量翻译问题,提出将质量评估分解为两个独立组件:基于多语言嵌入的平行性评估和无参考质量估计(QE)。在FLORES-200和BOUQuET任务上对6,654个语言对进行平行性测试,并在41,412个语言对的专业翻译上评估了九种无参考QE模型。结果表明没有模型能在所有翻译方向上表现稳定,无参考QE模型合并反而降低效果,且覆盖目标语言的广度与更高QE得分密切相关。整体来看,多语言平行数据的质量评估应被视为一个针对不同语言对进行有方向感的路由和校准问题,无法依赖单一通用指标。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。