CaRE——针对掩码扩散语言模型的计算感知重掩码评估协议
掩码扩散语言模型(MDLMs)近年来快速发展,但其评估标准未同步完善,导致不同研究中因步数、指标和采样温度差异,使得策略排名难以比较。本文提出CaRE,一种计算感知的评估框架,通过标准化实际函数调用次数、多指标报告以及控制随机性,公平审计MDLM的重掩码策略。实验证明温度对MAUVE指标影响最大,计算匹配比较颠覆了若干先前策略排名,并揭示重掩码与随机去掩码之间的性能权衡。CaRE排行榜涵盖12个不同规模和架构的MDLM模型,表明这一结果具有普适性。本工作发布了完整协议与实现,推动未来重掩码策略的可复现与可比性。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。