超越路由权重:通过贡献对比实现专家混合奖励模型的响应级忠实解释
奖励模型在基于人类偏好学习中至关重要,但其预测驱动因素难以识别。最新的稀疏专家混合(MoE)奖励模型通过将提示路由至专门专家,并根据高路由权重示例对专家进行表征,提升了解释性。然而,路由权重只反映专家接收了哪些提示,而未揭示专家如何评判响应,解释有限。本文提出贡献对比(CoCo)响应级解释方法,利用选择-拒绝响应对的最大贡献差异,联合捕捉路由和偏好行为,忠实表征专家作用。自动及人工评估表明,CoCo较基于路由、得分及稀疏自编码器的替代方案,提供更连贯、忠实和专业化的解释,且保持竞争性的奖励建模准确性。这是首个针对MoE奖励模型解释方法的系统研究。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。