- 类型
- 模型
- 来源
- AIHOT · X / 公众号精选
- 发布
- 2026年7月24日 13:40
- 状态
- 单一信源
01
发生了什么
蚂蚁百灵发布Ling-3.0-flash原生混合推理模型,总参数量124B,激活参数量仅5.1B,采用混合线性注意力架构与1/64稀疏MoE,扩展至10,000+可交互训练环境。在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T,长输入下TTFT降低60%至80%以上。
02
为什么重要
该模型以极低激活参数量实现与上一代旗舰模型相当的性能,大幅降低推理计算成本与延迟,尤其对长文本场景的响应速度提升显著,使高效部署低资源设备成为可能。
03
底层逻辑
原生混合线性注意力替代标准注意力,将长输入的计算复杂度从二次方降为线性;结合1/64稀疏MoE仅激活5.1B参数,在不牺牲能力的前提下显著减少每次推理的浮点运算量。
04
产品与商业机会
模型可部署在资源受限设备或高并发服务中,降低硬件成本;长输入TTFT降低60%-80%以上,使实时对话、文档处理等用户体验显著提升,后端推理吞吐量有望数倍增加。
- 将Ling-3.0-flash集成到现有AI客服或文档分析产品中,降低每请求推理成本并加快响应速度。
- 利用其低激活参数量,开发可在端侧(如手机、IoT设备)运行的轻量级智能助手。
- 针对长文档摘要、合同审查等场景,提供比传统模型更快的首令牌时间,提升用户留存。
05
仍待确认
- 模型的训练数据规模、具体评测基准指标未在证据中披露。
- 上一代旗舰Ring-2.6-1T的性能细节以及对比测试环境尚不清楚。
- 模型的开闭源状态及商用授权方式未说明。
- 混合线性注意力在不同类型任务(如多轮对话、代码生成)上的泛化能力是否一致有待验证。