CaRE:面向掩码扩散语言模型的计算感知重掩码评估协议
Masked Diffusion语言模型(MDLMs)迅速发展,但其评估标准未能跟上步伐,导致不同研究之间评估不一致。本文提出CaRE,一种计算感知的评估框架,通过标准化实际函数评估次数(NFE)、多指标报告和显式控制随机性,系统比较了7种重掩码策略。结果显示温度对性能指标MAUVE影响最大,计算匹配后部分策略排名发生逆转,并揭示重掩码与随机解掩码存在冲突。CaRE排行榜涵盖12个模型,确保未来评估结果更具可比性和重复性。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。