向量并非中立:从导出的大型语言模型表示中推断敏感信息的风险
大型语言模型(LLM)摘要系统可能将私密输入的向量表示传递给下游检索、监控或分析流程。即使源文档受限,导出的向量仍可能在不同访问控制下被使用,从而支持对敏感信息的推断,存在信息泄露风险。研究以临床出院摘要生成为案例,审计了两种导出向量:最终提示令牌隐藏状态和均值池化表示。结果表明,减少一种向量中敏感信息的可恢复性,不一定降低另一种向量的可恢复性。提出的SurfaceLoRA方法针对导出向量进行参数高效微调,降低目标向量中电子健康记录记录的种族信息的可恢复性,同时保持摘要效用,但其他向量的敏感信息仍较易恢复,表明隐私审计和缓解应针对具体导出向量进行。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
