标记错误的症状:评估医学文本中大型语言模型的水印效果
本文首次严格研究了大型语言模型(LLM)水印在医疗领域的表现,测试了5种水印方案,涵盖11个LLM和7个视觉语言模型(VLM),评估了单模态和多模态临床推理任务。通过引入专家验证的审计流程,分析了水印对医学推理质量、术语精确度和虚假信息的影响。结果显示,水印会导致词汇污染、虚假术语、图像发现误归因或遗漏等多种严重表现下降。研究强调缺乏领域特定评估和依赖总体指标可能掩盖医疗文本中的实际问题。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。