- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月30日 16:01
- 状态
- 单一信源
01
发生了什么
WIDE是一种端到端可微分的token级动态宽度剪枝框架,针对LLM推理的prefill和decode场景设计。它允许每个token动态选择注意力头组和FFN通道组,实现细粒度计算分配。在50%稀疏度下,相比最先进的动态深度剪枝方法,WIDE实现了55.1%的性能提升。
02
为什么重要
现有静态结构化剪枝硬件友好但精度损失大,动态剪枝又局限于粗粒度结构。WIDE首次将动态剪枝扩展到神经元块级别,并通过剪枝-内核协同设计实现实际加速,为高效LLM推理提供了新路径。
03
底层逻辑
WIDE通过两阶段训练流水线学习token级稀疏执行模式,允许每个token动态选择注意力头组和FFN通道组,将动态剪枝从层级扩展到神经元块粒度。为实用化,提出剪枝-内核协同设计,将动态稀疏加速分解为掩码重排序、硬件无关的块级跳过和硬件相关的块内跳过,实现高效执行。
04
产品与商业机会
在50%稀疏度下性能提升55.1%可能降低推理延迟和成本,适用于需要实时响应的LLM应用,如聊天机器人和代码生成。但动态剪枝可能增加部署复杂度,需平衡精度与效率。
- 在LLM推理服务中集成WIDE框架,在保证质量的前提下提升吞吐量,降低单次推理成本。
- 针对高并发、低延迟场景(如实时对话)优化模型,利用动态剪枝提升响应速度。
- 开发支持动态剪枝的推理内核库,减少部署门槛,便于现有系统集成。
05
仍待确认
- WIDE在真实负载下的实际加速比是否与基准测试一致?
- WIDE对不同模型架构(如MoE)和硬件平台的泛化能力如何?
- 两阶段训练流水线对训练数据量和计算资源的具体要求未在证据中说明。
- 动态剪枝带来的精度损失在多数任务上是否可忽略?