展开目录
#OpenAI#GPT-5.6#推理加速#Cerebras#AI基础设施

OpenAI 推出 Ultrafast 模式:GPT-5.6 Sol 提速 14 倍,每秒输出 750 tokens

OpenAI 发布全新 Ultrafast 模式,让最新最强的 GPT-5.6 Sol 模型以 14 倍速度运行,每秒最高输出 750 tokens,由与 Cerebras 的芯片合作驱动。这意味着「实时速度」不再等于「牺牲模型能力」,推理加速正在改变 AI 应用的天花板。

预计阅读 4 分钟

一句话总结

OpenAI 发布全新 Ultrafast 模式,让最新最强的 GPT-5.6 Sol 模型以 14 倍速度运行,最高可达 750 tokens/秒 的输出速度,背后是与芯片公司 Cerebras 的合作。这打破了过去「想要快,就得用更小、更专的模型」的固有逻辑——实时速度与顶尖能力,第一次可以兼得。


什么是 Ultrafast:把「最强大脑」提到实时速度

如果你曾经觉得 ChatGPT 反应有点慢,OpenAI 这次似乎直接回应了你的期待。

8 月 13 日,OpenAI 推出名为 Ultrafast 的新模式,目标是「大幅加速」其最新、最强大的模型 GPT-5.6 Sol 的工作速度。官方给出的数字相当惊人:

  • 14 倍于标准处理速度;
  • 最高 750 output tokens/秒(token 是 LLM 与人类交互时生成文本的最小单位)。

OpenAI 在博客里点出了这次突破的本质:

「直到现在,想要实时速度,通常意味着选择一个更小、更专的模型。Ultrafast 指向的是一条新方向:每秒做更多有用的事(more useful work per second)。」

换句话说,过去「速度」和「能力」是一对矛盾——要快就得用小模型、牺牲智商;要聪明就得忍受慢响应。Ultrafast 试图把这道选择题抹掉。

Ultrafast 速度对比:750 tokens/秒 vs 标准模式

作为参照,Anthropic 的 Claude 也推出了加速版「fast mode」,但据 TechCrunch 报道,其速度尚无法达到 OpenAI 这次给出的量级。


背后的技术:与 Cerebras 的芯片合作

Ultrafast 目前处于 preview(预览)阶段,其动力来自 OpenAI 与芯片公司 Cerebras 的合作。

Cerebras 的招牌产品是「晶圆级引擎」(Wafer-Scale Engine)——把一整块晶圆做成一颗巨型芯片,相比传统 GPU 集群,它在内存带宽和单芯片算力密度上有着天然优势,特别适合推理场景下的高速 token 生成。

Ultrafast 架构:OpenAI 模型 + Cerebras 晶圆级推理引擎

一个值得注意的细节是:这次 preview 只向一小部分客户开放,OpenAI 表示会随着「算力扩容」逐步扩大访问范围。这侧面印证了 Ultrafast 的核心约束不在模型,而在专用推理硬件的供给——这也解释了为什么它选择与 Cerebras 这类芯片厂商深度绑定。


能拿来做什么:四大企业级场景

OpenAI 给出的 Ultrafast 落地场景,都指向「延迟敏感」的高价值工作流:

场景为什么需要 14 倍速度
事故响应(Incident Response)安全告警需要秒级判断与处置,慢一秒就可能扩大损失
客服与支持用户等待的每一秒都在消耗耐心,实时对话体验直接决定满意度
金融市场分析行情瞬息万变,分析结论的时效性就是价值本身
电商搜索、推荐、议价等环节的实时响应直接关联转化率

Ultrafast 的四大企业级应用场景

这四个场景有一个共同点:它们对「延迟」的敏感度,不亚于对「答案质量」的敏感度。 过去企业要么接受慢响应,要么换小模型牺牲质量。Ultrafast 让「又快又强」第一次成为可选项。


为什么这件事重要:推理加速的行业含义

Ultrafast 的意义,远不止「ChatGPT 变快了」这么简单。它至少释放了三个信号:

  1. 「实时智能」正在成为新的竞争维度。当模型能力逐渐拉平,谁能在同样的质量下更快地吐出结果,谁就能在客服、交易、安全等场景里占据先机;

  2. 推理硬件成为新的军备竞赛焦点。Ultrafast 与 Cerebras 绑定,说明「专用推理芯片」正在从幕后走向台前——它不再只是降本手段,而是决定产品体验天花板的战略资源;

  3. 「能力 vs 速度」的取舍正在被打破。过去「要快就用小模型」的经验法则,可能很快过时。当最强模型也能实时响应,「小而快」的模型还能守住多少护城河,值得重新审视。

推理加速正在重塑 AI 应用的竞争格局

当然,眼下 Ultrafast 还只是 preview、只开放给少数客户,真实体验和可用性仍需观察。但方向已经足够清晰:AI 的下一个战场,正在从「谁更聪明」转向「谁又快又聪明」。


总结

  • 14 倍提速:Ultrafast 让 GPT-5.6 Sol 以 14 倍速度运行,最高 750 tokens/秒;
  • 🧠 打破取舍:「实时速度」不再等于「牺牲模型能力」——又强又快成为可能;
  • 🔧 Cerebras 加持:动力来自 OpenAI 与 Cerebras 的芯片合作,推理硬件成为新焦点;
  • 🏢 四大场景:事故响应、客服、金融分析、电商——全是延迟敏感的高价值工作流;
  • 🔭 仍待观察:目前仅 preview、小范围开放,但「谁又快又聪明」的竞争已经开跑。

数据来源:TechCrunch 2026-08-13 报道 OpenAI Ultrafast 模式发布;OpenAI 官方博客。

Related

相关文章

延伸阅读

查看全部 →