- 类型
- 新闻
- 来源
- OpenAI News
- 发布
- 2026年8月14日 17:19
- 状态
- 多源确认
发生了什么
OpenAI 推出名为 Ultrafast 的新 API 服务层级,由 Cerebras 硬件驱动,使 GPT-5.6 Sol 推理速度比标准处理快 14 倍,输出速率高达每秒 750 tokens。该模式目前仅供部分 API 客户预览,随容量扩大逐步开放。OpenAI 内部安全调查工作流从 1-2 小时缩短至 10-15 分钟,有时接近实时。
为什么重要
OpenAI 首次将推理速度作为独立产品层级销售(Standard、Fast、Ultrafast),并由外部硬件厂商 Cerebras 提供算力,标志着推理速度本身开始成为差异化卖点,可能改变企业级 AI 应用的实时性边界。
底层逻辑
Ultrafast 的高吞吐量(750 tokens/秒)依赖于 Cerebras 硬件,来自 OpenAI 与 Cerebras 的 100 亿美元合作。速度提升使原本需要 1-2 小时的安全调查缩短至 10-15 分钟,接近实时,表明推理延迟成为交互迭代的瓶颈,消除后可解锁并行搜索、根因分析等新工作流。
产品与商业机会
对 API 用户而言,实时或近实时的模型响应可支持更长的上下文和更多迭代轮次。开发团队需评估 Ultrafast 层级的价格与配额,并针对高速场景调整应用架构(如流式输出、并行调用)。内部安全调查速度的显著提升暗示了类似的长耗时任务(如代码审查、日志分析)可能受益。
- 面向安全团队推出基于 Ultrafast 的实时威胁检测与调查辅助工具,将平均调查时间从小时级压缩至分钟级。
- 构建并行搜索类产品,利用 750 tokens/秒的吞吐量同时发起多个检索任务,并实时聚合结果。
- 开发交互式代码开发辅助功能,利用快速反馈保持开发者心流,如实时错误分析与自动重构建议。
- 为企业用户提供推理速度分层定价选项,将 Ultrafast 作为高级 SLA 的一部分,按需计费。
仍待确认
- Ultrafast 模式的价格与配额规则尚未公开,其对成本的影响未知。
- Cerebras 硬件的规模化能力是否足够支撑广泛的企业级接入,仍有待观察。
- 高速推理是否会影响 GPT-5.6 Sol 的输出质量,证据中未提及。
- Ultrafast 与 Standard/Fast 模式的具体延迟和成本对比数据尚未披露。