AREX Feed Article
OpenAI 产品老大承认 GPT 5.6 发布四大失误,Sam Altman 转发背书
7 月 9 日,OpenAI 举办了一场声势浩大的发布会,Sam Altman 在 X 上连发数条推文预热,称 GPT 5.6 Sol 是 "obviously the best model we have ever produced"。直播中,OpenAI 一口气甩出三张牌:GPT 5.6 系列模型(Sol/Terra/Luna)、ChatGPT Work agent、以及将 Codex 合并进 ChatGPT 桌面端。这被外界解读为 OpenAI 的 "Super App" 时刻——一个应用统御聊天、编码和自动化工作。
24 小时后,OpenAI 产品负责人 Thibault Sottiaux(内部人称 Tibo)发了一条截然不同的推文。他没有庆祝,而是逐一列出了发布中的四大失误。Sam Altman 随后转发了这条推文——用他自己的 540 万粉丝为下属的坦诚背书。这条推文在不到一天内获得了超过 12,800 次点赞、1.4 百万次浏览,以及 423 条引用转发。
这不是 OpenAI 第一次在产品发布上出现执行问题,但这是它第一次在问题发生后 24 小时内,由核心产品负责人用如此具体、坦诚的方式公开认错,并附上一份分阶段的修复路线图。
史上最强模型,史上最混乱的发布体验
发布会当天,Sam Altman 的兴奋溢于言表。他在 X 上写道:"5.6 livestream going now. in addition to the model, 3 major product things. 1. ChatGPT Work—really big deal! 2. new ChatGPT desktop app 3. hosted sites"。OpenAI 官方博客用大量篇幅展示了 GPT 5.6 Sol 的 benchmark 成绩:Agents' Last Exam 得分 53.6,比 Claude Fable 5 高出 13.1 分;Coding Agent Index 得分 80,超越所有竞品;BrowseComp 达到 92.2%。
但用户打开更新后的应用,看到的不是更强的模型,而是一个让他们集体困惑的产品。
知名科技博客 Spyglass 的作者 MG Siegler 在体验后写了一篇题为 "The ChatGPT 'Super App' Sort of Super Sucks" 的评论。他写道:"I am so confused right now. I mean that literally. Trying to use the new ChatGPT app on the Mac, I'm confused." 他的核心抱怨:一个叫 ChatGPT 的应用,打开后默认不是聊天模式,而是 Work 模式;聊天功能被塞进了侧边栏的弹出窗口里;Codex 似乎消失了,但实际上藏在了一个叫 "ChatGPT Codex" 的下拉菜单中。
Reddit 上的反应更加直白。在 r/ChatGPT 板块,一篇题为 "ChatGPT Desktop/Codex Desktop app merger is a big disappointment" 的帖子获得了大量共鸣。用户写道:"They nerfed the ChatGPT app for desktop." Hacker News 上也有类似的声音:"I just installed this. I am very confused. I no longer have a Codex app on my computer. ChatGPT is now Codex. But what happened to ChatGPT?"
从三个产品到一个 Super App,OpenAI 赌的是什么
要理解这次发布的混乱,需要先理解 OpenAI 到底想做什么。
7 月 9 日的发布核心是三件事的同步推进:第一,GPT 5.6 系列模型全面开放——旗舰 Sol、平衡版 Terra、低成本 Luna;第二,推出 ChatGPT Work,一个以"交付成品"为目标的 agent 模式,用户描述需求后,agent 自主完成分析、生成、格式化,交回的是一个可直接使用的文档、表格或网页应用,而不是一段对话;第三,将 Codex 桌面端合并进 ChatGPT,形成 Chat / Work / Codex 三模式统一的单一应用。
这不是一次简单的功能更新,而是一次产品哲学的转向。OpenAI 不再把 ChatGPT 定位为一个聊天工具,而是定位为一个"工作操作系统"(Work OS)。Tibo 在推文中说得直白:"We think bringing ChatGPT and Codex together into a workspace where people and agents can collaborate is a very important step forward."
从数据上看,这个转向有充足的用户行为支撑。OpenAI 透露,超过 500 万人每周使用 Codex,其中超过 100 万人——占每周活跃用户的五分之一——用 Codex 做的是软件开发之外的工作:市场分析、财务建模、运营管理。这些人发现了一个事实:一个被包装成"编码工具"的产品,比他们公司采购的"商业软件"更好用。ChatGPT Work 要做的,就是把这个发现变成默认体验。
但问题在于,OpenAI 在一个发布窗口内塞进了太多变化。新模型、新模式、新 UI、新品牌逻辑——四层改动同时落地,让用户无从适应。
Tibo 的认错清单:四件事 OpenAI 承认搞砸了
Tibo 在推文中列出了四个具体问题,每一个都指向产品设计层面的判断失误。
第一个失误:最高算力设置太容易触发,使用限额的消耗速度远超预期。 "We made it too easy to use the highest-compute settings without making the impact on usage limits sufficiently clear," Tibo 写道。GPT 5.6 Sol 的 ultra 模式默认启动四个并行子 agent,每个都在独立消耗 token。很多用户发现,半小时到 45 分钟的高强度使用就能烧光五小时的额度。一位用户在回复中抱怨:"Half an hour to 45 minutes of usage runs on 1.5x speed using Sol High or extra high or max is just not usable with the five-hour rate limit being devoured like that."
作为补救,OpenAI 在 24 小时内执行了两次全域使用额度重置。Tibo 在第二条推文中透露了背后的压力:"Thank you for pushing our systems to the absolute limit, we have never seen traffic increase so quickly." 这条第二条推文本身也获得了 6,200 次点赞和 54 万次浏览。
第二个失误:桌面端改版过于激进,用户找不到熟悉的功能。 "We reorganized the desktop app in one bold move, making familiar things like chats and projects harder to find," Tibo 承认。实际上,Chat 功能被从主界面降级为侧边栏的一个弹出窗口,而 Projects 则被直接隐藏。对于每天依赖 ChatGPT 桌面端进行日常工作的用户来说,这相当于一夜之间被换了一个完全不认识的工具。
第三个失误:Codex 的定位让粉丝恐慌。 "Our launch framing was focused on ChatGPT Work and to some of our Codex fans it made it feel like Codex was going away over time. Absolutely not our intention, we love Codex and it is here to stay." 这个问题的根源在于产品整合的叙事方式:OpenAI 把 Codex 合并进 ChatGPT 的消息,听起来更像是"Codex 被 ChatGPT 吞并了",而不是"Codex 成为了 ChatGPT 的编程模式"。Sam Altman 在发布会当天就试图灭火,专门发推强调:"codex is the core of our new work product and what makes it so good. codex is not going anywhere."
第四个失误:多智能体工作流出现回归问题,插件和其他功能也有毛刺。 "We introduced regressions for some existing multi-agent workflows, alongside a collection of rough edges in plugins and other parts of the experience." 有用户反馈 MultiAgentV2 API 出现严重 bug 已被回滚禁用,其他用户报告了 Computer Use 快捷键失效、Codex Remote 在 Android 上无法正常加载等问题。
"Professor Reset":Tibo 是谁,以及 Sam Altman 为什么转发了他的道歉
Thibault Sottiaux 在 OpenAI 的头衔是 Codex & ChatGPT 产品负责人。他的 X 账号 @thsottiaux 简介只有简短一行:"Codex & ChatGPT @OpenAI",但他在 OpenAI 用户社区中的存在感远超这个简介所暗示的——社区给他起了个绰号叫 "Professor Reset",因为他经常在系统压力过大时亲自宣布额度重置。
这个绰号的背后是一种罕见的用户关系。在大多数科技公司,产品负责人是一个远离用户的角色。但 Tibo 形成了一种独特的风格:用口语化、个人化的方式直接与用户沟通,不做 PR 过滤。他的推文开头 "Hello beautiful people!" 已经成了一个标志性开场白。在这次认错推文中,这个开场白之后紧跟着 "Now that I have your attention"——他知道额度重置才是用户最关心的,于是先把这个好消息放在最前面,再开始说正事。
Sam Altman 的转发是这个事件的重要放大器。它传递了两个信号:第一,Tibo 的发言代表了 OpenAI 的官方态度,不是个人行为;第二,OpenAI 的最高管理层允许并鼓励这种级别的公开坦诚。在一个 CEO 转发通常只用于庆祝里程碑或转发媒体正面报道的行业惯例中,Sam Altman 转发一条产品负责人的认错声明,本身就是一种声明。
社区分裂了:有人在庆祝额度重置,有人已经换回了 GPT 5.5
Tibo 推文下的 1,894 条回复构成了一个迷你民意调查。这些回复大致可以分为三派。
第一派是"额度难民"。他们的核心诉求不是 UI 好不好看,而是额度够不够用。回复区最高赞的诉求之一来自 Paul Batum(前微软工程师):"I appreciate you and your work. But its frustrating that you added the banked resets feature and are not using it. Its actually worse than not having the feature because it tricks me into thinking that I won't miss out." 其他用户反复追问:"为什么不能把额度重置存进银行的格子?""我没有收到第二次重置。"
第二派是"Codex 捍卫者"。他们对 Codex 被"藏起来"感到愤怒。一位用户写道:"My gripe was that codex was seemingly essentially removed from the mobile app but it's just this new 'Remote' tab. I'm just confused how someone at OpenAI was like 'Yea they'll figure it out'." 另一位用户则提出了分开两个应用的建议:"Why try to combine spoon and fork?"
第三派是"快速迭代派"。他们认为 OpenAI 的认错速度和修复承诺本身就是竞争力。一位用户总结道:"shipping fast is important. listening fast is even more important. the best products aren't the ones that never make mistakes. they're the ones that improve quickly after real users speak up." 另一位用户将 OpenAI 和 Anthropic 做了对比:"Actively listening to user feedback and trying to improve? Anthropic could never."
而在所有这些声音之上,一个更根本的焦虑正在浮现:GPT 5.6 Sol 的推理能力确实令人印象深刻,但如果每次使用都要精打细算额度——选择 xhigh 还是 medium,用不用 ultra——那么模型的进步和用户体验的退步之间,到底谁的权重更大?
修复的时间表:今天修什么,下周修什么
Tibo 列出的修复计划分为两个阶段。
今天(7 月 11 日)已经或即将落地:两次额度重置(第一次已执行,第二次在发推后 12 小时内执行)、修改默认设置和模型选择器的默认值,让用户不会无意中进入最高算力模式、修复若干插件提交流程的 bug、改进 Codex 在产品中的呈现方式、清理桌面端最紧急的问题。
下周将落地:将 Chats 和 Projects 重新放回侧边栏,采用更熟悉和可定制的方式、让使用额度和重置时间更加可视化、明确解释何时使用 ChatGPT Work 和何时使用 Codex、处理用户反馈中的其他大量细节问题。
值得注意的是,OpenAI 并没有撤回任何产品决策。合并的方向不变,Work 的方向不变,新桌面端的方向不变。他们在做的事情是:保持方向,修复执行。Tibo 的最后一句写道:"The ambition behind this launch hasn't changed. But an ambitious direction doesn't excuse avoidable confusion or regressions in the first version."
编辑观察
这次事件真正值得关注的,不是 OpenAI 的产品团队犯了错——任何在短时间内同时交付新模型、新产品模式和新 UI 的团队都会犯错——而是他们在犯错后的反应机制。
24 小时内,产品负责人用个人账号发表了一份没有 PR 话术、逐条列出具体问题的声明。CEO 通过转发为这份坦诚背书。修复计划分阶段给出,从"今天做什么"到"下周做什么"清晰明确。用户社区虽然有大量抱怨,但整体情绪不是"你们搞砸了就完了",而是"你们搞砸了,但我们看到了修复路线,所以我们继续用。"
这与科技行业传统的危机公关模式形成了对比——后者通常是在问题发酵数天后,由一个官方账号发表一份措辞完美的声明,其中包含大量对问题的委婉表述和零条具体修复时间线。
Tibo 的推文证明了一件事:在产品复杂到用户已经跟不上的时代,坦诚比完美更有说服力。但这句话成立的前提是——你必须真的在下一条推文里把修复交付了。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供参考,不构成任何投资或使用建议。转载需注明出处。