- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 06:31
- 状态
- 单一信源
01
发生了什么
PolyQ是一种面向CPU的端到端量化框架,通过编译器与量化协同设计实现激活感知的通道位宽分配,支持2、3、4、8、16位宽。在三个典型CPU上测试,该框架能将激活重排流量减少70.8%,预填充延迟和解码吞吐量按位预算比例缩放,能量开销低于2%。
02
为什么重要
此前CPU低比特量化要么只能选择粗粒度位宽,要么采用混合精度但难以在CPU上高效执行。PolyQ将细粒度的分数位预算转化为实际的CPU部署方案,使推理性能可预测且能效高,扩大了LLM在边缘CPU设备上的可用性。
03
底层逻辑
PolyQ在编译时根据激活值分配每通道位宽,然后通过模型编译器将通道重排并聚合为位宽一致的块,生成兼容SIMD和查找表的执行内核,并在不同算子间合并兼容的排列,从而将布局规划从运行时路径中移除,实现高效的分数位推理。
04
产品与商业机会
开发者无需依赖GPU即可在CPU上高效部署LLM,降低硬件成本。PolyQ的编译时优化使推理延迟和吞吐量可预测,能量开销极低,适合电池供电的边缘设备,可加速CPU端推理产品落地。
- 将PolyQ框架打包为CPU LLM推理加速库,供设备端部署使用
- 针对主流CPU型号预生成不同位预算下的优化内核,降低用户配置门槛
- 在现有量化工具链中集成PolyQ的通道分配策略,提升混合精度部署效率
05
仍待确认
- PolyQ对更大参数规模模型(如100B以上)的扩展性和效果如何?
- 与其他CPU量化方法相比,PolyQ在更多模型和数据集上的泛化性能是否一致?
- PolyQ的编译时开销是否会影响实际部署流程?
- PolyQ是否支持在线动态位宽调整以适应不同负载?