一致不等于对齐:人类与大型语言模型伦理判断中的道德基础差异
研究发现,虽然大型语言模型(LLM)与人类在伦理判断的最终标签上常有较高一致性,但背后的道德依据和推理方式存在显著差异。通过一个包含500项的伦理判断基准测试,结果显示模型和人类虽然给出相同的判断结果,但关注的道德类别如伤害、尊重、守诺、正义等分布不同。这表明仅靠标签一致性评价模型对齐容易产生误导,需结合对推理和道德原则的分析。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。