上下文搜索何时有效?基于采样复杂度的反思驱动推理理论
本文提出了一个将上下文搜索建模为对推理轨迹的近似推理的理论框架,其中基础模型定义先验,自我反思提供后验更新反馈。研究了推理时间内的采样复杂度,即达到高成功概率所需的序贯尝试次数。结果表明,当反思能可靠地定位早期错误时,上下文搜索能实现指数级性能提升,用多项式数目的尝试解决零次尝试概率指数小的问题;反之,条件化过去尝试不会带来渐近优势。该提升是稳健且可学习的,基于交叉熵训练的近似后验更新可用多项式样本复杂度恢复所需行为。此外,分阶段的强化学习理论中最优策略执行相同的后验重加权规则。实验验证了以上理论预测。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
