NOLLI:一个用于诊断英韩性能差距的难度校准谜题基准
我们介绍了NOLLI,这是一个程序生成的英韩谜题基准,包含15种谜题类型(25个任务;7,500个条目),每个实例均可重复生成且有唯一解。该基准通过行为表现调校难度,使参考模型在指定准确率范围内。设计包括直接翻译、韩文字母改编及基于韩国文化的专有任务,主要用于诊断韩语模型性能差异。评估显示大部分模型英韩准确率相近,但涉及韩文子音字母的任务差异显著,揭示了多步骤子音拼接执行的困难。此外,结构大小未必代表难度。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。