AREX Feed Article
不讲基准讲"有趣":OpenAI 第三次更新 GPT-5.5 Instant,AI 竞争悄然转向体验
2026 年的 AI 竞赛有一条不成文的规矩:每一次模型更新,都得配一套基准测试数字。SWE-bench 涨了几个点、AIME 刷新了多少分、MMLU 有没有被新模型碾压——行业分析师会逐项拆解,竞争对手会连夜做对比表。但 6 月 24 日,OpenAI 打破了这个规矩。它更新了 ChatGPT 的默认模型 GPT-5.5 Instant——一个数亿人每天都在用的模型——却没有发布任何新基准数字。OpenAI 官方账号在 X 上的公告只有一句话:"这个版本聊起天来更有趣了(much more fun to talk to)。"
在一个靠智商说话的行业里,OpenAI 选择了谈情商。
三次迭代,一次比一次"软"
GPT-5.5 Instant 最早在 2026 年 5 月 5 日首发,取代 GPT-5.3 Instant 成为 ChatGPT 的默认模型。首发版本打的是硬核牌:OpenAI 内部评估显示,在医学、法律、金融等高风险领域,幻觉声明比前代减少了 52.5%;在用户标记的"特别容易出错"的对话中,不准确声明降低了 37.3%。AIME 2025 数学基准从 65.4 跃升至 81.2。这组数字在当时引发了密集报道。
5 月 28 日的第一次更新画风开始转变。OpenAI 把它称为"回复风格和质量更新"——回答更短、更自然、更少使用分点列表,不再过度格式化。
6 月 24 日的这次更新,OpenAI 干脆连一个数字都不报了。官方发布日志列出了三个方向:更好地识别问题背后的真实目标并在多轮对话中保持上下文、更可靠地处理含有多重约束的复杂指令、以及让购物和本地推荐更加连贯有用。ChatGPT 官方账号补充的细节是:格式化不再模板化,而是"更有创意,同时更克制"(greater creativity alongside better restraint)。
Digital Trends 在第一时间报道中指出了关键变化:新模型能判断用户到底是要实用建议、情感支持、深度分析还是快速回答,而不是不管三七二十一抛出一套标准答案。此前旧版 GPT-5.5 Instant 常被用户吐槽"像一个过度热情但没读懂空气的实习生"——上来就列五条建议,每条再分三个小点。新版则学会了先判断场景,再选择回应姿态。
这背后是一个被称为"意图适应"(Intent Adaptation)的技术方向。从 OpenAI 发布日志的措辞来看,这并不是简单地给模型装了一个分类器来判断"用户现在想干什么"。更准确的描述是:模型在生成回答之前,先识别问题的底层目标,然后据此选择回答的"形状"——对于购物类查询,可能默认采用对比表格;对于本地推荐,可能优先调用工具而非依赖训练数据中的静态知识。当用户加入约束条件、澄清自己的意思或对模型的回答提出异议时,模型会调整策略,而不是固执地重复最初的回答方式。
Kie.ai 在其深度分析中将这种能力与 OpenAI 旗舰模型的表现做了关联。代码审查平台 CodeRabbit 此前发布的 GPT-5.5 评估报告显示,在一项精选代码审查基准上,GPT-5.5 的"预期问题发现率"达到 79.2%,而基线仅为 58.3%;精确度从 27.9% 提升到 40.6%。这些数字来自旗舰版的思考模型(Thinking),并非 Instant,但其中贯穿的一条主线——更好地遵守范围限定的指令、减少跑偏的回答——与 Instant 本次更新的目标一致。
AI Builder Club 的一条热评切中了要害:"大多数用户每天并不会触及硬核推理的极限。他们问的是快速、意图密集的问题:买什么、去哪儿、选哪个、接下来干什么。这更接近搜索,而不是编程。真正的商业价值可能首先在这里显现。"
测试平台 TestingCatalog 确认了推送顺序:6 月 24 日先推送给 Pro 和 Plus 用户,免费用户在次日获得更新。从推文数据来看——发布 24 小时内超过 150 万次浏览、9200 余次点赞、713 次转发、344 次引用——用户对这一轮更新的关注度不亚于此前的旗舰模型发布。
两条轨道,两种逻辑
这次更新发生在一个异常拥挤的时间窗口。就在两天前的 6 月 22 日,OpenAI 通过 Daybreak 计划发布了 GPT-5.5-Cyber 的完整版。这是一款面向网络安全防御的专业模型,在 CyberGym 基准上达到 85.6%,远超基础 GPT-5.5 的 81.8%。同日,OpenAI 还宣布了与 Trail of Bits 共同发起的开源安全计划 Patch the Planet,已有 cURL、Go、Python、Sigstore、pyca/cryptography 等超过 30 个开源项目加入。Anthropic 工程负责人 Tibo Sottiaux 称之为"网络防御加速的一天"。
再往前推,4 月 23 日 GPT-5.5 旗舰模型正式发布,OpenAI CEO Sam Altman 称之为"迄今为止最聪明的模型",配套发布了包含 Terminal-Bench 2.0、Expert-SWE、GDPval、OSWorld-Verified、Toolathlon、BrowseComp、FrontierMath 等多个基准的完整评估报告。
Kie.ai 在其深度分析中揭示了一个被行业忽视的模式:OpenAI 正在维持两条快速分化的产品轨道。旗舰轨道——GPT-5.5、GPT-5.5 Pro、GPT-5.5-Cyber——每次发布都附带系统卡、完整的基准测试报告和合作伙伴计划。Instant 轨道则不同:一段推文、一段发布日志、没有新评估、没有系统卡更新。Kie.ai 一针见血地写道:"当 OpenAI 希望被引用时,它会发布一个数字。"
但 Instant 才是消费者真正使用的模型。OpenAI 联合创始人兼总裁 Greg Brockman 在转发本次更新时只加了一句"much more fun to talk to"——这种极简口径与旗舰模型发布时长篇技术博客的对比本身就说明了一切。事实上,自 GPT-5.5 Instant 5 月首发以来,OpenAI 对其的所有更新都保持着相似的节奏:6 月 9 日推送了个性化改进,让模型更有效地利用用户的历史对话、上传文件和关联的 Gmail 数据来定制回答;6 月 18 日又悄然强化了健康领域的能力,使 Instant 在 HealthBench 评估中达到了与旗舰思考模型相当的性能水平。每一次都是小更新,但每一次都覆盖数亿用户。
与此同时,预测市场 Polymarket 显示,市场对 GPT-5.6 在 6 月 22-28 日窗口内发布的概率定价为 76%。有社区声音指出,这次 Instant 更新可能是在为 GPT-5.6 铺路——先优化默认体验,再推出新旗舰。但 OpenAI 对此未做任何回应。唯一可以确定的是,OpenAI 正在同时推进两条战线:一条面向开发者和前沿用户的性能军备竞赛,另一条面向数亿普通用户的体验打磨——而后者的迭代速度正在肉眼可见地加快。
对手在卷什么?
在"对话体验"这个维度上,OpenAI 的动作是最激进的。但这不意味着竞争对手没有自己的押注方向。
Anthropic 的 Claude 走的是深度推理和长上下文路线。上周刚推出的 Claude Tag 功能直接把 AI 嵌入 Slack 频道,定位为团队的"数字同事"——多名成员可以在工作环境中共同与同一个 AI 交互。这更像是把 AI 从聊天界面中"解放"出来,而非打磨聊天本身。Anthropic 的差异化叙事始终围绕"安全性"和"可控性"展开,对话的趣味性从来不是其营销语言的一部分。
Google 的 Gemini 依托搜索和生态集成,主打信息获取的广度。在 Android 和 Google Workspace 的深度集成使其更像是"无处不在的助手",但对话的个性化和趣味性并非其优先级。Google 更倾向于强调 Gemini 在复杂推理和多模态任务上的技术指标。
xAI 的 Grok 押注实时数据和"无过滤"表达,风格鲜明,但在用户基数和产品打磨上与 ChatGPT 仍有数量级的差距。Grok 的"有个性"更多来自内容立场而非交互设计。
从 5 月 5 日 GPT-5.5 Instant 首发时强调"更温暖、更自然的语气",到 5 月 28 日砍掉冗余分点和过度格式化,再到 6 月 24 日直接说"更有趣"——OpenAI 正在系统性地优化一个同行们很少公开谈论的指标:用户是否真的想和这个模型聊天。
日本社区的反应也值得注意。拥有 3.4 万关注者的 AI 博主 "わど"(@wad0427)写道:"GPT-5.5 Instant 要变了,对日常使用 AI 的人来说是个好消息。"而拥有 1.7 万关注者的设计师 @knshtyk 的一条吐槽则获得了 329 次点赞:"版本号是干什么用的?更新一下版本号啊,定期。"这反映了部分用户对 OpenAI 用"新版本"而非新版本号来描述更新的困惑——但从另一个角度看,这也正是 OpenAI 想达到的效果:让用户在不知不觉中感受到体验的改善。
Digital Trends 的判断或许最准确地描述了这场竞争的走向:"AI 的未来不属于纸上最聪明的那个模型,而属于人们最爱聊的那个。"如果这个判断成立,OpenAI 这次不发布基准测试的更新,可能比任何一次"最强模型"的发布都更具战略意义。
唯一的基准测试
回到最开始那个问题:当整个行业都在用基准数字衡量进步时,OpenAI 选择用"是否有趣"来描述自己最常用模型的更新。这不是放弃了技术追求,而是重新定义了竞争的维度。
GPT-5.5 Instant 的数亿用户不会看 SWE-bench 的分数——他们甚至不知道这些缩写代表什么。但他们一定会在明天打开 ChatGPT 时,感受到一个更会聊天、更懂自己的助手。那才是唯一重要的基准测试。
参考链接:
- OpenAI 官方公告推文:
- ChatGPT 发布日志(6 月 24 日更新):
- OpenAI GPT-5.5 Instant 产品页面:
- Digital Trends 报道:
- Kie.ai 深度分析:
- Let's Data Science 综述:
- Releasebot OpenAI 更新汇总:
© 本文为机器之心原创,转载请联系本公众号获得授权。