AREX Feed Article
OpenAI 预览 GPT-5.6 Sol Ultrafast 模式:每秒最高 750 token,先向 API 小批客户开放
8 月 13 日(UTC 时间 17:01),OpenAI 官方 X 账号发布预览:GPT-5.6 Sol 新增 Ultrafast 模式,速度最高为标准处理的 14 倍,由 Cerebras 提供算力,每秒最多输出 750 token。该模式首先在 OpenAI API 向一小批客户开放,OpenAI 表示将随产能增长逐步扩展到更多企业()。
第二条推文把定位说得更直白:把「我们最智能的模型」(our most intelligent model)带进「每秒都很关键」的产品和工作流,并链接到 OpenAI 的()。Cerebras 同日在自己的账号上贴出一组对比演示:同一个「给分析师搭一个金融终端式仪表盘」的 prompt,Ultrafast 用时 1 分 50 秒,Standard 用时 12 分 20 秒,结果相同,快了近 7 倍()。
14 倍是上限,演示里实际快了近 7 倍
14 倍是「up to」(最高)的标称值。Cerebras 博客中的对比图把三档速度并排列出:Ultrafast 14 倍、Priority 2.5 倍、Standard 1 倍()。公开的演示都没有跑到 14 倍,仪表盘任务和基准测试里的实际提速多在 5.6 到 7 倍之间。
Cerebras 反复强调,Ultrafast 上跑的不是缩水版模型:「That's the full, GPT-5.6-Sol model -- up to 14× faster than the same model on Standard processing」(这是完整的 GPT-5.6-Sol 模型,比同一模型的标准处理最高快 14 倍)()。官方新闻稿进一步称,Ultrafast 与 Standard 拥有「同样的智能」()。
OpenAI 产品团队的 Rohan Varma 在 Cerebras 博客里说:「With GPT-5.6 Sol Ultrafast, Cerebras enables AI that keeps up with how you think, code, and collaborate」(GPT-5.6 Sol Ultrafast 让 AI 跟上你思考、写代码和协作的节奏)。
OpenAI 研究员 Jeffrey Wang 的描述更具体:「Whereas formerly I might have to wait a couple minutes for a task to finish, it now finishes for me before I even have the opportunity to context-switch」(以前我可能要等几分钟任务才跑完,现在它在我来得及切换上下文之前就完成了)。
2,500 道题 11 小时 11 分跑完,精度持平
Cerebras 用 Humanity's Last Exam(HLE)做了对比。按 Cerebras 的说法,这个 2,500 题的基准通常只有化学、经济学、文学等领域的博士学历人群答得出。GPT-5.6 Sol Ultrafast 跑完全部题目用时 11 小时 11 分;Claude Fable 5 用时 78 小时 27 分,连续计算三天多才得出相同结论。Ultrafast 以接近的准确率快了近 7 倍。
Cerebras 注明测试方法:7 月 10 日,Sol Ultrafast 配 Codex 的 xhigh 推理档;Fable 5 在 7 月 13 至 15 日用 Claude Code 的 xhigh 档跑完。
另一个基准 GDP-Val 测法律文书、金融模型、工程报告等有经济价值的知识工作。Cerebras 称 Ultrafast 拿到 5.6 倍端到端提速,质量无损失。博客中的对比图给出明细:Ultrafast 总墙钟时间 83.0 秒,其中模型请求 68.1 秒;Standard 总耗时 7.7 分钟,其中模型请求 7.5 分钟。
Cerebras 还引用 Artificial Analysis 报告的输出速度做横向比较:Ultrafast 比 Claude Fable 5 快 11 倍,比 Fast 模式下的 Claude Opus 4.8 快 5 倍。这些数字是 Cerebras 单方的测试口径;博客页脚也注明,性能对比基于第三方基准或内部测试,实际提速会随负载、配置和测试时间变化。
44 GB SRAM 全在片上:为什么快的是 Cerebras
提速来自 Cerebras 的晶圆级引擎(Wafer-Scale Engine)架构。每片晶圆大小的芯片上封装 44 GB SRAM,模型权重留在片上,token 在跨晶圆流水线的模型层之间流动。相比之下,GPU 推理要把权重在片上存储与片外存储之间反复搬运,显存带宽成为瓶颈。这是 Ultrafast 选择 Cerebras 硬件给出的技术解释。
速度用来做什么,OpenAI 在推文里点名五类场景:实时语音和客户支持、电商、编程与设计、金融研究、安全响应。Cerebras 博客补了两个更具体的情形:线上服务出故障时,用 Ultrafast 定位根因,把宕机时间压回 SLA 之内;对抗性的网络攻击中,安全团队靠它更快地检测和响应。
Cerebras CEO 兼联合创始人 Andrew Feldman 说:「GPT-5.6 Sol on Ultrafast is proof that speed and intelligence are no longer mutually exclusive」(Ultrafast 上的 GPT-5.6 Sol 证明,速度和智能不再是二选一)。
产能是唯一公布的时间表
开放节奏写得明确:先是一小批客户。OpenAI 在第三条推文里说,正与首批客户合作,弄清这种速度在哪里产生的差异最大,再用这些经验指导产品演进;有需求的企业可以申请在产能扩大时收到通知,链接指向 openai.com/form/ultrafast(、)。Cerebras 也开放了自己的登记页()。
OpenAI 计算战略与 GPT-Infra 副总裁 Sachin Katti 在新闻稿里说:「We're starting with a small group of customers to learn where that speed creates meaningful value, and we'll use those learnings to inform how we expand the service over time」(我们从小批客户开始,弄清速度在哪里创造真正的价值,再用这些经验指导服务如何扩展)。
这次预览有前奏。7 月 30 日,OpenAI 宣布 GPT-5.6 Luna 降价 80%、Terra 降价 20% 的同时,已经预告「为 API 中的 GPT-5.6 Sol 提供更快选项」();8 月 6 日,GPT-5.6 Sol 才向 Plus 和 Pro 订阅用户开放 Instant 与深度推理()。Ultrafast 目前的入口只有 API。
容量是另一条硬约束:Cerebras 在 8 月 12 日公布的二季度业绩里列出「与 OpenAI 合作服务 GPT-5.6 Sol」,云收入同比增长 281%,另有 600 MW 数据中心容量已签约()。「随产能增长扩大」因而不是客套话。
评论区排队问:价格、质量、订阅用户何时能用
截至发稿,OpenAI 的首条推文约有 91 万次浏览、9,500 余个赞、480 余条回复,评论区的疑问高度集中。The Browser Company 的 prompt engineer Nick Dobos 问:「So umm the $200/mo plan is part of the select group of customers, right?」(每月 200 美元的订阅方案算不算「一小批客户」?)()。
开发者 Mihai Matei 问的是价格和范围:「what's the token cost for this? is it api only or in the codex plan too presumably?」(token 怎么计价?只有 API 能用,还是 Codex 套餐里也有?)()。
独立开发者 Ian_Codes 说:「14x is no joke. Curious how the quality holds when it's that fast in actual use」(14 倍不是开玩笑,想知道真用起来质量是否扛得住)()。
圣保罗的用户 Victor Taelin 表示自己已经填了申请,疑问更偏技术:「it is the full Sol model? how is that possible, I thought it'd be Luna? what is the context limit」(这是完整的 Sol 模型吗?我原以为是 Luna,上下文窗口多大?)()。「是不是完整 Sol」这个问题 Cerebras 已经回答:是完整模型、智能不缩水。上下文长度双方都没有披露。
OpenAI 的三条推文都没有给出 Ultrafast 的价格,也没有给出订阅用户和 Codex 能用上的时间表。对企业来说,目前唯一可做的具体动作,就是填那张「容量扩大时通知我」的表单。