UnpredictaBench:评估大型语言模型分布随机性的新基准
UnpredictaBench是一项测试大型语言模型(LLM)捕捉真实底层分布能力的评估基准。随着LLM越来越多地被用来替代其他实体(如经济模拟中的人类),模型趋向于仅给出单一合理答案,未能体现真实系统的不可预测性。UnpredictaBench设计了448个简化但核心的采样问题,涉及统计分布、随机程序和自然语言描述的随机过程。该基准引入KS@N评价指标,通过Kolmogorov-Smirnov检验量化模型样本与目标分布的接近度。测试显示各模型在分布采样能力上差异显著,最高也未超出40%,表明该能力仍有很大提升空间。即使引入推理,提升有限,表明简单的分布模拟对LLM依然是挑战,是将LLM用作复杂系统代理的必要前提。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。