AREX Feed Article
OpenAI 披露首款自研推理芯片 Jalapeño:称每瓦峰值吞吐为商用系统 1.5~1.9 倍,拟年底起部署
2026 年 9 月 8 日(约 13:15 UTC),OpenAI CFO Sarah Friar 署名在 OpenAI 官网发布博客《The Work Now Within Reach》,披露公司战略与运营指标。其中的一项核心进展,是公司首款自研推理芯片 Jalapeño 的测试数据与部署计划:OpenAI 称,在 InferenceX 测试中,Jalapeño 的每瓦峰值 token(词元)吞吐达到所测商用系统的 1.5~1.9 倍,端到端延迟低 1.7~3.6 倍,公司计划自今年年底起将其投入部署()。
同一篇博客披露的其他指标包括:产品每周活跃用户超过 10 亿,企业客户达 250 万家;研究组织每 1 个人类工作日对应 3.1 个 agent-工作日(agent,即智能体);GPT-5.6 Sol 使端到端服务成本降低 20%、token 生成效率提升 15% 以上。上述数字均来自 OpenAI 自报,博客未附第三方审计。
Jalapeño:三个公开模型上测出的两个倍数
博客将 Jalapeño 称为 OpenAI 的首款自研推理芯片。OpenAI 称,在 InferenceX 测试中,跨三个公开模型,Jalapeño 以额定芯片功率做归一化后,每瓦峰值 token 吞吐达到所测商用系统的 1.5~1.9 倍;端到端延迟则低 1.7~3.6 倍。部署计划方面,博客写明 OpenAI 计划自年底起部署 Jalapeño,与 NVIDIA、AMD 及其他合作伙伴的加速器并列使用。
这组数字的参照系需要一并读。OpenAI 没有在博客中点名被对比的商用系统,只说明对比对象是 InferenceX 测试中所涵盖的商用系统,并以额定芯片功率做归一化。1.5~1.9 倍与 1.7~3.6 倍都是特定测试集、特定归一化口径下的峰值结果,能否在生产环境中复现,要等年底部署之后的实际运行数据。
Friar 在博客中把 Jalapeño 放进 OpenAI 的全栈算力战略(full stack compute strategy)里解释:该战略覆盖数据中心、芯片、软件、模型和产品,OpenAI 把这些选择放在一起管理,在能力、速度、可靠性、效率和成本之间为每种工作负载寻找最强的组合;在自研能带来性能或成本改善的地方自研部件,在合作伙伴提供最优方案的地方继续采用合作方式。训练前沿模型和运行快速交互 agent,对基础设施的要求并不相同。
消费与企业业务如何互相带动
博客披露的另一组核心指标是规模:OpenAI 的产品触达超过 10 亿周活跃用户和 250 万家企业,研究进展通过 ChatGPT、ChatGPT Work、Codex 以及基于其 API 构建的应用传导给用户,一次模型研究投入可以支撑多个产品及其多元化收入流。
Friar 用一个循环来解释消费端与企业端的关系:在家里用过 ChatGPT 的人会把这份熟悉感带到工作中,企业部署又给员工提供适配复杂工作与组织要求的工具,工作场景的使用体验反过来改变他们对个人场景中 AI 的期待。博客还引用了 OpenAI 自己的研究:在针对个人版 ChatGPT 用户的调研中,用户注册六个月后的每日消息量比第一个月高出约 50%,尝试过的不同任务种类约为最初的两倍。
商业模式上,博客写明的路径是:免费访问由广告支持,帮助用户发现 AI 在哪里有用;订阅和按用量计费则让客户在发现更多价值后增加支出。开发者进一步扩大触达范围,为 OpenAI 自己未必会识别的需求构建应用。
OpenAI 研究组织怎样给 agent 派活
博客为「更多工作变得值得做」给出的内部例证,来自 OpenAI 自己的研究组织。博客引用研究团队近期的更新称,研究人员借助 agent 更快地贡献代码、运行更多实验,并把越来越复杂的任务委托给 agent;团队用 agent 解决过去需要专家支持的基础设施问题。OpenAI 给出的量化口径是:研究组织现在每 1 个人类工作日的人力投入,对应 3.1 个 agent-工作日。
博客同时写明了人的位置:研究优先级仍由人设定,结果也由人判断,agent 给研究人员腾出的是追逐有前景想法的余量。对客户故事,博客列举了波士顿儿童医院(Boston Children's Hospital)的案例:借助 AI 辅助研究,专家在此前未解决的罕见病病例中找到了答案,涉及超过 40 个诊断。
GPT-5.6 Sol 先在软件层压低服务成本
在 Jalapeño 之前,成本优化已经先发生在软件和模型层面。博客披露,GPT-5.6 Sol 帮助改进了 OpenAI 的生产服务软件,使端到端服务成本降低 20%;额外的改进让 token 生成效率提升 15% 以上,使系统在同样的算力下产出更多结果。
Friar 把客户真正在意的结果归纳为「完成的任务」:更好的模型可以用更少的尝试完成任务,更好的软硬件能让每一次尝试更快、更便宜,两头同时改进,OpenAI 就能用自建和采购的容量服务更多工作。博客写明,Jalapeño 正是把这项工作延伸到硬件层面的那一步。
一套自报数据的读法
全部关键数字都出自 OpenAI 单方面的自报:芯片对比结果出自 InferenceX 测试,参照的商用系统未被点名,博客未附第三方审计。Friar 称 GPT-6 Astra 是「世界最智能且对齐的模型」,并在计算机使用、浏览、软件工程、网络安全、科学和专业工作等领域达到最优水平(state-of-the-art),这同样属于 OpenAI 的自评,博客未附第三方基准佐证。
这篇博客延续了 Friar 的署名博客系列,此前已有《The full stack behind abundant intelligence》《What building an AI-native finance function taught me》《A scorecard for the AI age》《A business that scales with the value of intelligence》四篇,本篇是最新一篇。博客把前面的安排收进一个复利逻辑:消费与企业触达让每次模型进步直达客户,全栈算力战略让智能以更好的性能和经济性交付,增长的使用带来收入,收入再投入下一代研究与基础设施。
资金纪律是博客给这套逻辑设置的检验标准。博客写明,OpenAI 用三条标准判断每一笔投资:它能服务多少需求、多快形成生产力、回报是否能覆盖投入的资本。年底 Jalapeño 是否如期部署、部署后生产环境中的每瓦吞吐和延迟能否接近测试数据,将是这三条标准遇到的第一份公开答卷。