构建用于关键词提取的学术论文多模态数据集
通常,关键词提取任务仅依赖文本数据,忽视了图像和音频中的视觉及音频信息,导致信息丰富度不足,且忽略潜在关联,限制了模型表示学习和预测准确性。现有用于关键词提取的多模态数据集稀缺,阻碍了多模态关键词提取研究进展。该研究构建了包含1000个样本的学术论文多模态数据集,每个样本包含论文文本、图像、音频和关键词。通过无监督和有监督方法,利用论文文本、图像及音频提取的文本进行了关键词提取实验,探讨了不同模态信息及其融合对性能的影响。实验结果表明,不同模态文本在模型中表现出特征差异,论文文本、图像文本和音频文本的组合显著提升了关键词提取效果。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。