确认我们的偏见?评估大型语言模型的能力、风险及社会影响
本文研究大型语言模型(LLMs)对提示框架的敏感性,评估其在鼓励支持或挑战特定立场的直接和暗示性提示下的响应表现。通过对六个LLMs使用160个涵盖十个主题的提示进行实验,发现模型的回答会系统性地调整以匹配提示框架,即使在事实性问题中也会受此影响,提示框架的效应甚至可能超过事实一致性。结果表明,大型语言模型在一定程度上易受用户细微偏见的强化及明确提示操控,影响事实稳定性。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。