边际覆盖能否保证零样本视觉-语言模型在分布转移下的类条件安全性?
分割一致性预测在交换性条件下提供边际覆盖,日益被用作零样本视觉-语言模型(VLMs)的拒绝层。本文审计了CLIP、OpenCLIP和SigLIP在ImageNet及非ImageNet环境下的部署转移表现。结果显示,尽管边际覆盖保持较高(约0.86),但类条件尾部覆盖显著下降:在ImageNet-Sketch中,表现最差类别的覆盖几乎为零,且10-12%的类别低于有限样本假设下限。该失效与目标域类别准确率相关,但源域诊断无法预测。源域蒙德里安校准提升了分布内尾部覆盖但不具备迁移性,聚类一致性及Conf-OT改进了边际或平均指标,却未恢复最差类尾部覆盖。目标端类别校准可显著提升尾部表现,但需每类标签且计算开销大。还发现存在2-3倍的跨家族效率差距,SigLIP的原生sigmoid分数破坏了APS概率质量的解释。上述结论在不同模型规模、预训练数据、提示词、错过率和非ImageNet转移环境中均成立。因此,边际一致性覆盖应被视作平均可靠性指标,而非类别尾部的安全保障。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。