FrenchNews-7:跨出版商法语新闻编辑部分类基准测试
本文介绍FrenchNews-7,这是一个基于法国多出版商的大规模法语新闻编辑部分类基准,融合了多家媒体的新闻语料库、通过URL派生的七分类体系及微调的CamemBERT分类器。标签通过结合出版商URL标识与大语言模型注释的混合流程分配,并通过人类与大语言模型的互评研究审核。评测了多种词汇、跨语言及法语专用分类器在分布内及持出出版商设置下的表现,并与零样本大型语言模型基线做对比。最强模型CamemBERT-base基于全文表现最佳,优于仅用标题,能泛化到未见过的媒体,整体召回率优于所有零样本基线,尤其在模糊边界的经济与社会类表现突出。跨出版商评测显示边界稳定性差异,其中体育、文化与国际版块转移性好,经济与社会类别反映出更偏向编辑惯例而非模型限制。模型、数据集及指导表已开源。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。