- 类型
- 论文
- 来源
- Hugging Face Daily Papers
- 发布
- 2026年7月23日 00:00
- 状态
- 多源确认
发生了什么
SLAI T-Rex在Ascend NPU SuperPOD上对DeepSeek-V4系列模型进行全参数后训练,实现了34.22%的模型算力利用率(MFU),比开源基线提升2.93倍。随后构建约1万条高质量SFT样本的运筹学领域数据管道,使DeepSeek-V4-Flash在零样本Pass@1成绩达到71.81%,超越GPT-5.4-Mini和原始模型。
为什么重要
此前大规模LLM后训练主要依赖GPU集群,该方案首次在Ascend NPU集群上实现万亿参数级MoE模型的高效训练,MFU显著超越开源基线,证明NPU路线在大模型领域的可行性和竞争力。
底层逻辑
通过模型级并行、计算通信编排和底层核执行三级优化框架缓解内存压力和通信开销,提升训练效率;再基于优化后的基础设施,利用求解器验证的合成文档和领域数据构建CPT+SFT流程,增强模型在运筹学任务上的推理能力。
产品与商业机会
使用Ascend NPU的团队可获得现成的高效训练方案,降低对GPU的依赖;运筹学场景可快速获得专用高性能模型,提升自动化决策精度,减少人工设计启发式的需求。
- 基于SLAI T-Rex框架为使用Ascend NPU的客户提供模型后训练优化服务
- 推出面向供应链、物流等运筹学场景的DeepSeek-V4-Flash专用API
- 开发结合求解器验证的运筹学数据合成工具,提升领域模型的SFT质量
仍待确认
- 该框架在其他NPU平台或更大规模集群上的可移植性如何?
- 运筹学模型在真实业务场景中的推理延迟和部署成本是多少?
- 10K样本数据集是否计划公开或作为商业许可发布?
- 该优化方案对训练稳定性的具体影响是否有更详细的实验数据?