通过强化学习的推理引导部件级视觉定位
多模态大语言模型(MLLM)能从自由形式语言查询定位整个物体,但对于查询仅指定物体部件时效果较差。原因在于缺失了物体-部件层级结构,部件和物体被统一定位。本文提出对象-部件层级反射定位(OP-HRG),采用粗到细的推理方法,先定位父对象,再定位其中部件,并通过自我检查反思结果,扩展方法通过重编码预测区域进行校正。提出了一个部件感知的GRPO框架,用阶段性奖励训练该管线。训练的4B模型在PascalPart、PartImageNet和InstructPart数据集上优于7B定位LLM和SAM3,并可迁移到推理分割。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。