格式敏感指数:基于令牌控制的提示包装鲁棒性与模式合规性在大模型基准测试中的应用
本文研究了仅格式不同的提示包装对大语言模型得分的影响,提出了格式敏感指数(FSI)和可解析性敏感指数(PSI)两个指标。通过分析14万条跨7个问答任务、5类提示包装及4个不同规模模型的生成结果,发现模型间FSI平均值相差超过30倍,且主要由合规性失败解释。同时,解析性是准确率的重要预测因素。作者强调,在基准测试中若不考虑提示包装的变异和合规性,准确率报告容易产生统计学上的脆弱性,并给出了相关应用的实用建议。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。