扩展的多轮合成对话数据集用于钓鱼短信检测
该研究扩展了先前的COVA数据集,推出了包含10,985条老年人受骗类别对话的COVA-X数据集,通过改进生成流程提高数据质量。基于该数据集,Longformer模型表现超越了XGBoost,准确率达79.71%,宏F1为0.7786,验证了大型对话语料对Transformer模型性能提升的重要性。研究还报道了标签纠正率提升12.7倍和数据集清洗对模型效果的正面影响。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。