CANDI:针对细分领域问答的上下文对齐方法
随着大型语言模型(LLMs)在医疗诊断和财务咨询等专业领域的应用,评估其超越通识知识的能力变得尤为重要。传统的问答基准难以体现细致的上下文基础、用户意识及领域理解。为此,本文提出了CANDI-QA数据集,用于评估LLMs在专业环境中提供准确、上下文敏感且符合用户需求答案的能力。CANDI-QA由专家设计的问答对组成,分为信息辅助问题(直接提取事实)和应用推理问题(多跳推理以生成可操作见解)两类。作者测试了十多种语言模型,并提出了轻量级神经符号框架MTSS-Net作为基线,结合神经检索与规则推理。结果显示当前LLMs在细分领域语境对齐上面临重大挑战,强调了上下文和符号整合的重要性。CANDI-QA为上下文感知语言模型研究提供关键基准,推动高风险领域可信AI的发展。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。