点火指数:语言模型中全球工作空间动态的量化测量
本文介绍了点火指数(Ignition Index,I),一种经过验证的标量指标,用于将全球工作空间理论(GWT)的全或无点火预测运用于变换器语言模型。该指标通过拟合四参数Sigmoid函数,基于输入信号强度来分析每层线性探针准确率,提取陡峭度参数beta-hat:高值表示突发点火式转变,低值则为渐进式增长。在涵盖五种架构家族的11个模型中,洗牌标签对照实验显示该指标对真实语言结构的选择性是伪探针能力的9.6倍(p<0.001)。主要发现包括:1)前馈变换器的beta-hat平均比状态空间模型高89%(p<1e-13);2)Huginn-3.5B在迭代轴上展现出比深度轴高2.12倍的点火趋势,证明循环架构沿迭代维度体现工作空间式转变;3)Pythia-410M在训练步骤256时检测到相变,早于归纳头形成;4)点火与模型规模和信号强度的假设未被证实,暗示变换器架构可能已饱和其点火机制。点火指数为GWT动态预测与机制可解释性之间建立了首个经过验证的定量桥梁,展现前所未有的选择性和架构区分能力。代码公开于:https://github.com/saman-rahbar/ignition-index
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。