混合比例并非性能关键:诊断视觉-语言模型的少样本原型混合
本文研究了视觉-语言模型中少样本适配方法常用的零-shot文本原型与K个标注图像特征均值的凸组合分类策略,重点探讨了混合比例的最优值、无验证数据情况下的估计方法及其对性能的影响。作者证明理论上最优的比例估计实际上不能带来性能提升,且留一法在无验证集时可有效估计该比例。此外,无验证的线性探针方法在多个数据集和设置中均优于最佳混合比例方案,表明性能提升的瓶颈在模型类别本身而非混合比例调节。文中包括代码和详细实验记录。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。