AREX Feed Article
OpenAI 打响价格战:GPT-5.6 Luna 降价80%,模型自优化推理栈首次兑现为定价
7 月 30 日,OpenAI 宣布对 GPT-5.6 系列模型大幅降价:轻量旗舰 Luna 价格下调 80%,从每百万 token 输入 $1 / 输出 $6 降至 $0.20 / $1.20;均衡模型 Terra 下调 20%,至 $2 / $12;旗舰模型 Sol 价格不变,但新增 Fast Mode,以 2 倍价格提供最高 2.5 倍推理速度。这是 GPT-5.6 系列发布仅三周后的首次调价。
Sam Altman 在 X 平台上亲自发帖造势,称其为"major price cuts today"。该帖获得超过 18,000 次点赞和 260 万次浏览。OpenAI 官方公告帖浏览量超过 830 万次。
降价根源:模型自我优化的正循环
OpenAI 在 7 月 29 日的技术博客中披露了此次降价的工程基础:GPT-5.6 Sol 在 Codex 环境中自主重写了生产环境的 GPU 推理内核(基于 OpenAI 维护的开源语言 Triton 和 Gluon),将端到端推理服务成本降低了约 20%;同时,Sol 通过设计并运行数百次投机解码(speculative decoding)实验,将 token 生成效率提升了超过 15%。
这意味着"模型自我优化 → 推理成本下降 → API 降价"的正循环首次从实验室概念兑现为生产定价。OpenAI 表示这一过程仍在持续,形成了加速反馈回路。
价格对比:Luna 进入低成本区间
降价后的 Luna 综合价格(输入+输出)为 $1.40/百万 token。横向对比:
- Claude Opus 5(Anthropic):$30/百万 token,Luna 约为其 1/21
- Gemini 3.6 Flash(Google):$9/百万 token
- Gemini 3.5 Flash-Lite(Google):$2.80/百万 token
- DeepSeek V4 Flash:$0.42/百万 token,在纯 token 价格上仍低于 Luna
据 Artificial Analysis 的 Intelligence Index,Luna 在智能水平上超过 Gemini 3.6 Flash 和旧版 Gemini 3.1 Pro,使得 OpenAI 在"单位智能成本"维度占据显著优势。
开发者实测与早期反馈
Browser Use 创始人 Gregor Zunic(@gregpr07)在 X 平台发帖称,GPT-5.6 Luna xhigh 在 Browser Use 基准测试中的表现接近 Claude Opus 5,但价格便宜约 17 倍。该帖获得超过 570 次点赞和 11 万次浏览。
在 Hacker News 的讨论中,多位开发者表示 Luna 在日常编码辅助场景中表现可接受,但也有用户指出 Luna 在复杂项目中的工具调用和代码质量不及 Opus 5,建议采用"强模型规划、便宜模型执行"的策略。
同日竞争动态:DeepSeek V4 Flash 公测
降价公布次日(7 月 31 日),DeepSeek 的 V4 Flash 模型进入公开 Beta 测试,价格 $0.14/$0.28,支持 100 万 token 上下文窗口。V4 Flash 在 SWE-bench Verified 上达到 79.0%,接近 V4 Pro 的 80.6%,但价格不到后者三分之一。
过去两周内,Anthropic 发布了 Claude Opus 5($5/$25),Google 推出了 Gemini 3.6 Flash($1.50/$7.50)和 Gemini 3.5 Flash-Lite($0.30/$2.50),Moonshot AI 开源了 Kimi K3。前沿模型的推理价格曲线在 72 小时内近乎垂直下移。
注意事项
- 性能对比数据主要来自厂商官方声明和早期用户测试,独立的长期基准评测仍在积累中。
- Luna 的定位是高吞吐、低延迟场景(如分类、摘要、路由),在需要复杂推理的任务中仍需 Sol 或竞品旗舰模型。
- 订阅价格和配额未变,但 Luna 和 Terra 在 Codex 与 ChatGPT Work 中的使用计费将消耗更少积分。