AREX Feed Article
同一个模型,五种思考深度——OpenAI 砍掉模型切换器,换上思考滑块
8 月 6 日,OpenAI 向 ChatGPT Plus 和 Pro 用户推送了更新后的 GPT-5.6 Sol,同时上线了一个新控件:思考深度滑块(thinking depth slider)。用户不再需要在「日常模型」和「推理模型」之间来回切换,而是在同一个 Sol 模型内,从 Instant 拖到 High,自己决定 ChatGPT 该用多少算力回答问题。
同一天,免费用户也拿到了升级。GPT-5.6 Luna 成为 ChatGPT Free 和 Go 层的默认模型,下周起文本对话不再有速率限制。免费用户还会看到一个 Think 按钮,让 Luna 在难题上多花几秒推理。
OpenAI CEO Sam Altman 在 X 上发帖确认了这两项变化:「5.6 Sol much better in chat now — and unlimited text chat for free users!」
Altman 深夜发帖,ARC Prize 连夜重测
Altman 的帖子发出不到 12 分钟,ARC Prize 官方账号就发布了一组独立验证数据:团队在 GPT-5.6 Luna 降价 80% 后重新跑了一遍 ARC-AGI 基准测试。
结果:ARC-AGI-2 得分 59.6%,每次任务成本 $0.18;ARC-AGI-1 得分 90.7%,每次任务成本 $0.07。两项成绩与 Luna 原始版本持平,但成本只有原来的五分之一。
ARC Prize 联合创始人 François Chollet 转发了这条推文。一位 X 用户 @krab75292 在回复中算了一笔账:GPT-5.2 Pro 时代跑 ARC-AGI-2 每次任务 $15.72 只拿到 54.2%,现在 Luna 以 $0.18 拿到 59.6%——成本降了两个数量级而性能还在涨。
OpenAI 官方博客则披露了内部评测数据:在覆盖金融、医疗和法律领域的提示词测试中,GPT-5.6 Sol 出现至少一处事实错误的回复比 GPT-5.5 Instant 少了 68%;GPT-5.6 Luna 也比 GPT-5.5 Instant 少了 62%。不过 OpenAI 没有公开完整提示集和输出样本,这些数字仍是厂商自报。
从模型切换器到思考滑块,这一步走了多久?
ChatGPT 很长一段时间里把「快答」和「深思」拆成两个模型。日常问题交给 Instant 系列,复杂推理交给更大的模型。用户需要手动判断任务类型、再手动切模型——大多数人根本不切。
今年 7 月 GPT-5.6 家族发布时,Sol 作为付费主力、Luna 作为高效低价选项的格局已经成型。Luna 在上周刚经历一轮降价 80%,被 OpenAI 塞进了所有免费用户手中。
这次更新把 Sol 从 Codex 和 ChatGPT Work 里已经存在的思考深度滑块带进了普通 Chat 界面。滑块有五个档位,从 Instant(近乎即时回复)到 High(可能耗时数分钟)。,日常问题用低档足以应付,研究、编程、规划等任务拉高滑块后回复明显更详实。
这次微调只影响 ChatGPT 的 Chat 模式。GPT-5.6 Sol 在 ChatGPT Work 和 Codex 中的行为保持不变。
68% 更少的错误,一个滑块取代了两个模型
OpenAI 对 Sol 的调整集中在三个方向:回答更聚焦、根据问题复杂度自适应细节量、在需要纠正用户时敢于说不。
具体到行为上,问「美国总统是谁」会得到一行直接答案;问「美国选举怎么运作」会得到带背景说明的长回复。OpenAI 称 Sol 在处理日期、数字、来源、法律条文、医疗信息和金融问题时更不容易编造事实。
滑块背后的机制不是切换模型,而是控制同一个 Sol 模型的推理预算。The Decoder 报道称一位 OpenAI 开发者曾按任务类型拆解五个档位的适用场景,但:「用户几乎不用模型切换器,而选择正确模型对任务的影响可能远大于在五个推理档位之间选择。加更多旋钮并不一定让体验更好。」
免费用户拿到 Luna 无限量,但推理天花板还在
GPT-5.6 Luna 本周起成为 ChatGPT Free 和 Go 的默认模型,下周文本对话速率限制将被移除——不过文件上传、图片生成等工具用量仍受限。Think 按钮允许 Luna 在难题上额外推理,但它不会切换到更强的模型。
The Decoder 在稿件发出后收到了 OpenAI 的澄清:Luna 虽然比 Sol 小,但比此前免费用户的默认模型 GPT-5.5 Instant 有明显提升。OpenAI 表示「将免费用户描述为被限制在更弱体验中是不准确的」。
但 Bastian 坚持他的核心判断:免费层在绝对意义上确实进步了,但免费用户不再拥有任何接触 OpenAI 前沿推理模型的渠道。「这在过去并非一直如此,而且质量差距很难忽视。」
在 Hacker News 上,用户 firasd 的评论获得了高票:「Claude.ai 从未在免费层和前沿模型之间建立如此极端的壁垒——Sonnet 对免费用户开放,只是有限速。」另有一位用户提到,OpenAI 免费层的主要对手或许是 Google 搜索的 AI Overview(由 Gemini 3.5 Flash-Lite 驱动),以及 Gemini 3.6 Flash 慷慨的免费额度。
滑块背后:每一分算力都要算账
这次更新的真正变化不在于某个 benchmark 又高了几分,而在于 OpenAI 开始把「算力即成本」这个逻辑直接暴露给用户。过去,模型选择器隐藏了推理开销——用户不知道也不关心一次回答烧了多少 token。现在,滑块让用户自己决定:这个问题值不值得让模型多想几分钟。
,这个趋势与微软内部的转向同步。就在 OpenAI 公告前两天,404 Media 曝光了微软内部指引,标题直接引用了微软的原话:「Tokenmaxxing is not what we are optimizing for.」GitHub Copilot 今年 6 月切换到按 token 计费后,开发者发现 agent 工作流迅速烧光月度配额。控制 AI 消费正在从后台问题变成前台产品功能。
Sol 的推理滑块、Luna 的 80% 降价、免费用户的无限文本对话,三件事指向同一个方向:ChatGPT 不再只是「最聪明的模型」,而是一个可以按预算和需求精细调配的智能服务。剩下的问题是,用户是否愿意为一个本应自动判断何时该多想的助手,亲手拨动滑块。
参考链接
- OpenAI 官方博客:
- Sam Altman X 帖文:
- ARC Prize X 帖文:
- BleepingComputer 报道:
- The Decoder 报道:
- Visual Studio Magazine 报道:
- Hacker News 讨论: