面向工业因果推理的模拟器驱动大型语言模型:工具使用、结构化注入及可移植检索支持废水处理决策
废水运营者在询问诸如“N2O为何上升?”或“减少20%曝气会怎样?”等因果问题时,需基于工厂变量交互和效应传播速度的回答,而非通用预训练文本。本文对冻结的Qwen2.5-32B-Instruct模型利用可解释的废水模拟器(CCSS-IX)进行实地模拟调用(方法1)、结构化参数注入(方法2)和解耦回忆推理检索器(方法3)三种接地方式进行比较。三种方法在198个因果问题基准上的准确率分别为99.5%、79%和75.8%,远超最强检索增强基线的48%。方法3检索器参数仅1.1亿,单厂训练约17秒,跨厂转移后仍达88%,而方法2的静态表无法迁移。在60问反事实基准上,方法3能处理干预后的问题,优于方法2 16.3个百分点(95%置信区间[7.1,26.4]),且对时间尺度和操作状态类问题均达100%。在搭载OpenBookQA语料的AI2推理挑战中,选择性检索机制达79%,超越不受限的Llama-3.1-8B(76%)和全量注入(74%),显示非废水处理特定的领域外复现能力。本文首次提供单一模拟器下三种工业因果问答技术的综合比较。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。