DVPSFormer:面向自动驾驶的高效在线深度感知视频全景分割
安全的自动驾驶导航需要对动态环境进行整体理解,同时估计测量深度、语义分割和实例轨迹。深度感知视频全景分割(DVPS)将这些任务统一起来,但现有方法多依赖计算复杂的多阶段流程或离线跟踪,不适合实时决策。为此,我们提出了DVPSFormer,一种用于高效四维场景理解的统一在线架构。其核心是显式场景离散化(ESD),利用分割查询表示前景和背景区域,使离散到连续(D2C)深度头能单次解码测量深度,紧密结合语义与几何学习并显著降低延迟。此外,我们设计了在线多数投票(OMV)机制,利用时间一致性在实例跟踪中优化分类。DVPSFormer在Cityscapes-DVPS和SemKITTI-DVPS基准上刷新了性能记录,为在线机器人感知提供简洁有效的解决方案。代码和模型已公开。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。