超越相关性检索:面向评分标准的文档集选择与排序
随着大型语言模型和AI代理成为搜索结果的主要使用者,文档集质量决定了下游生成的上限。现有评估体系仅独立评分文档并通过nDCG聚合,忽略了文档间的冗余、冲突和互补等交互,无法判定何种文档集更优。本文提出完整的评估-诊断-优化框架,设计了覆盖短长文本的三层九维文档集评估基准SetwiseEvalKit,包含约2.8万条高质量评分标准。系统评估12种重排序方法,发现最佳方法覆盖率不超过45%,跨文档协同指标普遍较弱,且无单一方法能在两种场景均保持顶级表现。基于此,提出无训练的Rubric4Setwise方法,将评分标准转换为文档集选择信号,实现更优下游生成效果,使用文档更少、搜索轮次更少,且在两种场景下均保持最新成果,验证了从评估到优化闭环的有效性。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
