ToolSense:用于审计大规模语言模型参数化工具知识的诊断框架
大型语言模型作为代理在庞大工具库中面临关键的工具检索瓶颈。为解决嵌入式检索方法对专业工具语义捕捉不足的问题,参数化工具检索通过将工具编码为虚拟标记并进行两阶段微调,实现了强劲的检索性能。现有基准测试在查询和解码上存在限制,难以评估模型是否真正理解工具。ToolSense是一个开源的基于LLM的诊断框架,能自动生成多级歧义现实检索基准、多项选择和问答探测基准。应用ToolSense至ToolBench及多种训练配置揭示知识与检索能力的脱节现象,部分模型尽管检索表现优异,但在事实探测上表现接近随机。该框架及基准已开源。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
