- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月26日 03:51
- 状态
- 单一信源
发生了什么
Omni-Prune 是一种无需训练的查询感知音频-视频 token 联合剪枝框架,针对全模态大语言模型(OmniLLM)的推理效率问题。它通过自适应时间窗口、统一评分、跨模态配对及 K-medoids 选择,在保留超过 99% 模型性能的同时,实现了最高 3.25 倍预填充加速和 1.3 倍内存减少,优于现有基线方法。
为什么重要
此前 token 剪枝方法主要针对纯视觉输入,忽略了音频与视频的跨模态关联以及用户查询对重要性的判断。Omni-Prune 首次将查询感知机制引入音视频联合剪枝,且无需重新训练,大幅降低了全模态推理的延迟和内存占用。
底层逻辑
Omni-Prune 首先根据音频能量峰值划分自适应时间窗口,然后在每个窗口内利用编码器注意力与文本查询相关性对音频、视频 token 统一评分,将相关 token 配对保留,最后通过 K-medoids 算法选取少量代表性 token,确保多样性。
产品与商业机会
该技术可直接降低全模态大语言模型(如同时处理语音和视频的助手)的推理预填充延迟和 GPU 显存需求,无需额外训练即可部署,有助于将此类模型应用到实时交互、边缘设备或成本敏感的云端服务中。
- 在视频会议摘要 AI 中集成 Omni-Prune,实时剪辑并分析关键音频-视频片段。
- 为多模态搜索产品提供低延迟推理后端,用户提问后更快返回音视频相关内容。
- 作为推理加速插件用于开源全模态大模型,降低开发者部署成本。
仍待确认
- Omni-Prune 在流式输入场景下的性能如何?
- 与 int8 量化等其他优化技术组合后加速比是否叠加?
- 论文中的实验是否覆盖了音频-视频长度差异极大的真实场景?
- 该方法对不同语言或方言的音频鲁棒性如何?