- 类型
- 模型
- 来源
- Hugging Face Model Radar
- 发布
- 2026年7月22日 02:40
- 状态
- 单一信源
发生了什么
韩国公司Upstage发布开源大模型Solar-Open2-250B,参数规模2500亿但每个token仅激活150亿参数。模型采用混合注意力机制的MoE架构,融合线性注意力和softmax注意力,支持百万token上下文窗口。训练时从上一代模型Solar Open 1继承部分权重,降低了从头训练成本。模型专为代理工作流设计,包括工具调用、多步推理等任务。
为什么重要
此前主流开源大模型在长上下文场景下推理成本极高或上下文窗口有限。Solar-Open2-250B通过混合注意力和稀疏激活,以接近小模型的推理成本提供大模型能力,同时支持百万token,为代理型应用(如文档分析、代码生成)提供了更实用的开源选择。
底层逻辑
模型采用250B参数MoE,每次token仅激活15B。混合注意力堆叠中每4层有3层线性注意力(含NoPE去除位置编码)和1层softmax注意力,线性注意力通过循环状态隐含编码位置,使KV缓存仅需12层,内存占用约为全softmax模型的四分之一。训练时从Solar Open 1转移仅2.3%的权重,其余随机初始化,加速收敛。
产品与商业机会
开发者在构建需要长上下文(如整本书分析、大规模代码库推理)的Agent产品时,可使用此模型降低推理成本。产品团队可重新评估先前的部署方案:之前在百万token场景下不可行的MoE架构如今变得实用,且激活参数量小意味着更低的硬件需求。
- 基于1M上下文窗口开发企业级文档问答产品,支持一次性输入整份报告或合同进行语义检索与摘要。
- 利用其工具调用和多步推理能力构建面向数据处理的自动化Agent,例如自动生成代码脚本并执行结果验证。
- 在编码助手产品中集成此模型,实现跨多文件上下文的代码重构与调试建议。
- 建立长上下文的客服对话Agent,能回溯整段历史记录完成复杂任务转接。
仍待确认
- 模型在真实Agent基准测试(如GAIA、SWE-bench)上的具体得分?
- 推理成本的实际测算(比如每百万token的延迟与GPU用量)?
- 模型的开放许可证类型(商业使用是否受限)?
- 训练数据的规模与构成?