OmniMem:面向流式视听大型语言模型的扰动感知内存压缩
音视频大型语言模型在长视频理解中面临视频标记和键值缓存线性增长的问题。OmniMem提出了一种内存高效的流式框架,通过模态感知的内存分配策略,分别管理视觉和音频上下文,解决两者标记数量不平衡的问题。其利用扰动感知内存选择,保留有信息且非冗余的键值状态,实现紧凑内存同时维持长距离理解。结合预算感知微调,OmniMem在多个基准测试中比强训练自由压缩基线提升2-4%的准确率,微调后再提升1-2%。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。