大型语言模型的置信度校准
本文研究了大型语言模型(LLMs)在不同任务中的置信度校准情况。预注册研究结果表明,目前的LLMs像人类一样,表现出过度自信:其置信度平均高于实际准确率。值得注意的是,这种现象受硬-易效应影响:在难度较大测试中,过度自信最为明显;而在简单测试中,则表现出明显的低估自信。我们开发了LifeEval,一种用于评估模型在不同难度水平上校准能力的测试。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。