FinPerMA:基于理论和事件的面向LLM代理的个性化记忆基准
本文介绍了FinPerMA,一种用于评估大型语言模型(LLM)代理在金融等高风险领域中个性化记忆能力的基准测试。FinPerMA通过模拟真实投资者的长期轨迹,结合确定性理论规则、LLM叙述和自动质量筛查,重点测试模型在关键事件发生后能否持续更新用户偏好。测试276个虚拟用户的2994个问题显示,现有顶尖模型和记忆配置准确率仍未突破约47%,多项选择题准确率约39%。分析指出,基于摘要的记忆常保留事实细节但丢失偏好信息,简单检索有时胜过专门设计的记忆系统,且事件冲击后差距更明显。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。