视觉-语言模型能否从机器人第一视角图像评估近距离风险?
从机器人第一视角评估近距离危险对于人类环境中的安全导航至关重要,需结合视觉与场景理解。本文评估了三种开源视觉-语言模型(InternVL、Qwen-VL和SmolVLM)对机器人视角图像进行四级危险分类的能力,比较了三种提示策略和两轮QLoRA微调的效果。未微调时模型表现接近随机基线,微调后整体提升有限。但Qwen-VL配合高级提示在高危险案例的召回率显著优于其他模型。进一步分析显示,正确分类危险并不代表模型能更好定位人物区域,说明模型可能在未关注关键场景区域时依然生成有用的安全标签。结果表明当前视觉-语言模型在细粒度的空间风险推理和空间定位方面仍有限,但针对性提示和微调可提升特定模型对高危情况的检测。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。