通过GMM和LLM的目标数据增强实现不平衡数据聚类
在自然语言处理(NLP)中,处理数据中代表性不足的主题尤其具有挑战性,特别是在无监督任务中,聚类方法往往难以充分反映少数主题。本文提出一种创新的无监督数据增强方法,结合高斯混合模型(GMM)与大型语言模型(LLM)。利用GMM灵活且稳健的特性检测出数据中代表性较低的簇,随后LLM生成合成文本丰富这些簇的内容,提升其表现力。多组不平衡文本数据集上的实验表明,该方法在保持聚类性能的同时,常常增强了簇的可解释性,为无监督NLP任务中的数据表示改进提供了稳健且可扩展的解决方案。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
