信用卡、困惑、计算与后果:我们能揭示语言模型推理的什么?
我们介绍了CreditCardQA,这是首个基于真实信用卡协议、用于数字推理的金融素养基准数据集。数据集包含1800个问题,包括反映消费者自然提问方式的第一人称变体,涵盖费用、利息和支付等内容。我们在链式思维(CoT)和程序思维(PoT)提示下评估多种大型语言和推理模型。总体来看,PoT方法显著提升了模型表现,尤其是在推理能力较弱的模型中,并缩小了开源与闭源系统间的差距。错误分析显示,失败多因金融规则误用、遗漏条件和合同条款理解错误,而非算术错误。此外,比较、条件逻辑和金额限制属于特别挑战的题型,边缘案例如逾期罚款和小额余额更易导致错误,影响低收入或金融脆弱群体。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。