当词汇变化误导时:用传统及大语言模型指标重新思考动态主题模型评估
本文研究动态主题模型在捕捉随时间演变的词分布时,传统一致性指标在词汇变化但语义不变的情况下表现不足。通过对NYT、DBLP和arXiv三语料库中120个主题的评估,分为低、中、高词汇变化类别,发现传统指标与人工判断一致性波动较大(相关系数-0.256到0.614)。相比之下,大语言模型基于语义相似度的指标与人工语义判断高度一致,尤其在CoNTM模型中效果显著。词汇变化分层揭示了整体评价中隐藏的差异,作者主张结合传统一致性与大语言模型语义指标进行词汇变化意识下的综合评估。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。