使用最优传输聚合视觉信息以压缩VideoLM令牌
视频语言模型将视频处理为密集的视觉令牌序列,存在大量冗余。压缩这些序列对于减轻语言模型解码过程中的视觉令牌负担至关重要。该方法通过最优传输将视频帧观察的密集经验测度映射到紧凑目标测度,从而构建压缩表示。该方法结合任务和空间维度调整压缩过程,针对问题条件优化传输成本,并在不同空间粒度上计算区域特定时间传输计划,实现对相关内容的关注。评估显示,AVIOT在多种视频理解基准上表现不逊于未压缩模型,且在高压缩率下依然保持强劲性能。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。