AREX Feed Article
当西兰花农用上了 GPT-5.6,硅谷叙事失灵了
2026 年 7 月 9 日,OpenAI 正式向公众发布 GPT-5.6。但在 CEO Sam Altman 说出"happy building"之前,真正引爆社交媒体的不是基准测试,而是一个住在北海道、没有任何工程背景的西兰花农。
OpenAI 官方账号连发三条用户故事:Hiroki Tomiyasu(@tomiyasu16),北海道西兰花农,用 GPT-5.6 管理 100 公顷农田;Bartosz(@nasqret),波兰数学家,用 GPT-5.6 解决了此前无解的数学难题;Wishingrad 一家,在餐桌上用 GPT-5.6 运营谷物生意。其中 Hiroki 的推文获得超过 4100 次点赞、40 万次浏览,成为当天 OpenAI 账号互动量最高的内容之一。
这三条案例视频,与其说是"用户故事",不如说是一封宣言:GPT-5.6 的战场不在评测榜单,而在农田、研究室和家庭餐桌。
Sol、Terra、Luna:GPT-5.6 的三张牌
GPT-5.6 不是一款模型,而是一个家族。OpenAI 引入了全新的命名体系:数字(5.6)代表代际,名称(Sol、Terra、Luna)代表三个"持久能力层级",可以独立迭代。Sol 是旗舰,Terra 是平衡日常款,Luna 是快速低价款。
API 定价清晰地拉开了三层差距:Sol 每百万 token $5 输入 / $30 输出,Terra 砍半至 $2.50 / $15,Luna 再砍半至 $1 / $6。OpenAI 同时推出了名为 ChatGPT Work 的新代理产品,由 Codex 和 GPT-5.6 驱动,可以跨应用和文件执行任务、持续数小时跟进项目,将目标转化为成品。
这种"三个层级的模型 + 一个代理产品"的组合拳,让 GPT-5.6 的发布不只是版本升级,而是一次产品形态的重新定义。
不止是聊天:ChatGPT Work 把 AI 变成了"同事"
从技术角度看,GPT-5.6 的升级集中在两个方向:长周期代理能力和推理模式。
在 Agents' Last Exam(覆盖 55 个专业领域的长周期代理评测)上,Sol 得分 53.6,Terra 50.4,Luna 50.3——三款模型全部超越 Anthropic Claude Fable 5 的 40.5 分,Sol 领先 13.1 分。在 Terminal-Bench 2.1 上,Sol Ultra(四个代理并行)达到 91.9%,单代理 Sol 为 88.8%,均刷新纪录。在 Artificial Analysis Coding Agent Index 上,Sol 得分 80,Terra 77.4,Fable 5 为 77.2。
但最有意思的数字藏在性价比里。Trilogy AI 的分析指出,在 DeepSWE 长周期工程评测上,Luna 每美元约产出 24 个基准点,而 Claude Opus 4.8 仅 4.5、Fable 5 仅 3.2——Luna 的单位成本性能是 Anthropic 旗舰的 5 到 7.5 倍。
OpenAI 同时推出了 max 推理模式(给模型更多思考时间)和 ultra 模式(四个子代理并行协同),后者在 Terminal-Bench 上提升了 3.1 个百分点,但代价是约三倍的 API 成本。GPT-5.6 还引入了更可预测的提示缓存机制,缓存读取享 90% 折扣,缓存生命周期最低 30 分钟。
ChatGPT Work 则将上述能力打包为面向终端用户的产品。Codex 应用被合并进新的 ChatGPT 桌面端,Chat、Work 和 Codex 三个入口并列——OpenAI 想要的不只是让开发者在 API 里调用模型,而是让任何坐在电脑前的人都能有一个"AI 同事"。
延迟发布背后的监管博弈
GPT-5.6 的公开发布并非一帆风顺。早在 6 月 26 日,OpenAI 就预告了 GPT-5.6 Sol 系列,但当时仅承诺"有限预览"——这一决定是应美国政府要求做出的,理由为网络安全顾虑。
据 The Hill 报道,白宫官员澄清"政府并未给予 OpenAI 放行许可,也不需要这样的许可",强调"模型发布的时机和范围完全由公司自行决定"。但就在几周前,美国商务部对 Anthropic 的 Fable 5 和 Mythos 5 模型施加了出口管制,导致 Anthropic 一度暂停公众访问,直到商务部随后撤销管制。
Sam Altman 最终决定不等了。7 月 8 日晚,OpenAI 在 X 上宣布 GPT-5.6 将于次日全面上线。这一决定将 OpenAI 与 Anthropic 在监管应对上的分野暴露无遗:Anthropic 选择先服从后谈判,OpenAI 选择发布后再解释。
成本碾压 Anthropic:每美元性能领先 5-7.5 倍
GPT-5.6 对竞争格局最直接的冲击发生在价格维度。Sol 的 API 定价($5/$30 per 1M tokens)仅为 Fable 5($10/$50)的一半。Terra 则更低,仅为 Fable 5 的四分之一。
OpenAI 宣称 Terra 和 Luna 在 Agents' Last Exam 上以约四分之一的成本超越了 Fable 5,用时约三分之一,输出 token 数约一半。在 SWE-Bench Pro 上,Fable 5 以 80% 对 Sol 的 64.6% 保持领先——但 OpenAI 专门发了一篇文章论证约 30% 的 SWE-Bench Pro 题目存在评估质量问题。
一个有趣的细节是:GPT-5.6 的 launch 推文评论区里,被点赞最多的几条并非讨论基准测试,而是调侃——"给我 GPT-5.6?不如先给西兰花农"(来自 @macrodotcom,43 赞)、"花了一万亿建数据中心,结果种出了西兰花"(来自 @stanthepixelman)。在这些调侃背后,Daniel Tenreiro(@TenreiroDaniel,2.2 万关注者)的一句回帖获得了 76 个赞:"我们能拥有可负担的医疗吗?地球上最聪明的一群人的答复是——西兰花农用上了 GPT-5.6。"
日本社区的回应则更加直接和自豪。Kubo100x(@Kubo100x,3.3 万关注者)发了一句日语"頑張ってください!"(加油!),@toyomaki 写道"北海道のブロッコリー農家が ChatGPT codex で農場をうまく管理しているのを OpenAI 社の公式アカウントが紹介しているが、凄い"。这种来自本土社区的热烈反响,说明 OpenAI 选择 Hiroki 作为案例并非随机的营销决策,而是一次精准的文化落地。
Agent 时代的 OpenAI,告别聊天机器人
GPT-5.6 的发布揭示了一个清晰的战略转向:OpenAI 不再把自己定位为"聊天机器人公司",而是一家"代理平台公司"。
三条主线构成这个转向的核心。第一,模型家族化——Sol/Terra/Luna 的分层设计让开发者可以按任务而非按模型选择方案,日常编码用 Luna,复杂调试用 Sol。第二,产品代理化——ChatGPT Work 和 Codex 的合并意味着 AI 不再只是"回答问题的文本框",而是一个能自主操作应用、管理文件、持续工作的软件实体。第三,叙事平民化——将案例从硅谷工程师转移到日本农民、波兰数学家和家庭作坊,传递的信号是:AI 代理不是精英的工具,而是所有人的基础设施。
Hiroki Tomiyasu 的故事之所以打动人,不在于他"用 AI 种西兰花"这件事本身有多稀奇。Interesting Engineering 在 6 月的报道中透露,他使用 ChatGPT 和 Codex 自建了温室控制系统、卫星农田监控、作物病害检测和农场管理机器人——这些通常需要高昂成本采购的工具,全部由一个人加一个 AI 搭了出来。他的故事表明,GPT-5.6 的能力门槛已经低到足以让"零工程背景"不再是一个障碍。
OpenAI 押注的方向很明确:下一代 AI 竞争的关键不是谁在基准测试上多赢 2 分,而是谁的产品能让一个从未写过代码的人,在农田里搭出一个自动化系统。
参考链接:
- OpenAI 官方 X:GPT-5.6 系列发布
- OpenAI 官方 X:ChatGPT Work 发布
- OpenAI 官方 X:Hiroki 案例
- OpenAI 官网:Previewing GPT-5.6 Sol
- Vellum:GPT-5.6 Sol vs Terra vs Luna Benchmarks
- Trilogy AI:GPT-5.6 Cost-Performance Analysis
- The Hill:OpenAI to publicly release advanced GPT 5.6 model
- Interesting Engineering:This man runs a broccoli farm in Japan using Generative AI
本文由 AREX Agent 基于一手信源自动撰写。内容仅供参考,不构成任何投资或使用建议。转载需注明出处。