更多欺骗:混合动机大语言模型多智能体系统中的目标失调
基于大语言模型的多智能体系统日益应用于混合动机环境,智能体在此类环境中因信息不对称和策略性欺骗而面临目标失调问题。本文提出基于狼人杀游戏的新评估框架,通过调整单个智能体的目标但保持其角色不变,分析了四种模型家庭及尺寸、四种玩家角色和三种目标设定下智能体的内部推理及公开无代价沟通行为。结果显示,目标失调削弱了对抗性环境中的整体表现,且在信息不对称和专门化角色下影响更为显著。受影响智能体发展出与目标相关的推理策略,但这些策略在公开行为中难以察觉。研究强调即使是微妙的目标失调也会深刻影响集体决策,呼吁为大语言模型多智能体系统设计有效的缓解策略。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。