- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 04:37
- 状态
- 单一信源
01
发生了什么
一篇arXiv论文提出Seer框架,通过在第一个去噪步检测扩散多模态大语言模型(DMLLMs)中MLP激活稀疏性的变化,识别有效语义边界,一次性截断冗余的[EOS]填充令牌,无需重新训练。实验显示,Seer可将吞吐量最高提升约31倍,在9个基准上保持甚至提升性能(如DocVQA得分从63.52升至63.66)。
02
为什么重要
此前扩散多模态大模型因输出长度未知而固定填充至最大长度,造成大量冗余计算。Seer发现第一个去噪步即能揭示语义边界,实现一次截断,大幅减少无效计算,且无需微调即可即插即用,显著降低推理成本。
03
底层逻辑
Seer观察到DMLLMs在第一个去噪步中,有效语义对应令牌的MLP激活稀疏度与填充的[EOS]令牌存在明显差异。利用信噪比(SNR)标准检测该边界,并在此后所有计算中一次性截断冗余后缀。同时采用混合批处理策略,动态适应序列长度以维持吞吐收益。
04
产品与商业机会
直接提升基于扩散多模态大模型的推理速度最高31倍,降低GPU计算成本和延迟。但该方法仅适用于DMLLMs架构,且需模型支持动态长度推断,对现有推理系统需调整批处理调度以兼容混合执行策略。
- 将Seer集成到基于DMLLM的图片问答或视觉对话产品中,直接加速推理。
- 评估Seer在DocVQA等复杂视觉任务上的精度提升效果,用于优化产品表现。
- 针对批处理场景适配Seer的混合执行策略,提升服务端吞吐。
05
仍待确认
- Seer是否适用于所有DMLLM架构(如不同扩散步数或解码器结构)?
- 在更长序列或不同填充比例下,加速比是否稳定?
- Seer的SNR阈值是否需针对具体任务调整?未见消融实验。
- 该框架是否支持在边缘设备上低延迟运行?