AREX Feed Article
OpenAI Luna 降价 80% 一周后,Codex 用户发现便宜有好货——但有条件
顶级 Codex 用户问了一个所有人都在想的问题
一周前,Codex 重度用户 Peter Yang(25.6 万粉丝,以实用 AI 教程和访谈著称的独立创作者)在 X 上发了一条推文:
Hearing that GPT 5.6 Luna High is much cheaper and basically unlimited usage and I'm running low on Sol :P Can it do complex browser automation tasks? That's 50% of my Codex usage.
("听说 GPT 5.6 Luna High 便宜得多而且基本等于无限用量,我的 Sol 额度快见底了。它能搞定复杂的浏览器自动化任务吗?那可是我 Codex 用量的 50%。")
这条推文收获了 221 个赞、68 条回复和 6.3 万次阅读。回复区迅速分裂为两个阵营:已经大规模迁移到 Luna 并在生产环境中验证过的乐观派,和坚持"Sol 不可替代"的怀疑派。
这场辩论的背景是 OpenAI 在 7 月 30 日投下的一颗炸弹:GPT-5.6 Luna 的 API 价格被一刀砍掉了 80%。在 Codex 平台上,Luna 现在比 Sol 便宜 25 倍。对于 Peter Yang 这样每月消耗大量 Sol 信用点的重度用户来说,迁移到 Luna 不只是省钱:能不能把工作撑到月底才是问题。
68 条回复给出的答案,比任何一张基准测试排行榜都更复杂、也更有用。
两毛钱的模型,25 倍的价差
7 月 30 日,OpenAI 宣布 GPT-5.6 Luna 的 API 价格从每百万 token 输入 $1 / 输出 $6 降至 $0.20 / $1.20,降幅 80%。同期,中档模型 GPT-5.6 Terra 降价 20% 至 $2 / $12。旗舰模型 Sol 的价格保持不变($5 / $30),但新增了 Fast 模式——速度提升至 2.5 倍,价格翻倍至 $10 / $60。
在 Codex 的信用额度体系中,价差更加触目:Luna 每百万输入 token 仅消耗 5 个信用点,而 Sol 消耗 125 个。Codex 的订阅价格和配额预算均未变化。同样的工作,现在消耗的信用点骤降。
降价的直接触发因素不是市场营销,而是技术突破。OpenAI 让 Sol 自主重写了运行自身的 GPU 内核代码,推理成本下降了 20%,token 生成效率提升了 15%。省下来的成本被一比一转化为客户价格。OpenAI CEO Sam Altman 在 X 上简单写道:"今天大幅降价。"
不是营销决策:Sol 自己改了自己的推理内核
7 月 30 日的降价不是一个常规的商业调整。OpenAI 在官方博客中披露了一段被大多数媒体一笔带过的技术内幕:降价的钱,是 GPT-5.6 Sol 自己挣出来的。
GPT-5.6 于 7 月 9 日正式 GA 后,OpenAI 的工程师将 Sol 部署到 Codex 环境中,让它对运行自己的生产级 GPU 内核进行自主优化。Sol 使用 OpenAI 的开源 GPU 编程语言 Triton 和 Gluon 重写了这些内核,将端到端推理成本砍掉了 20%。与此同时,Sol 通过数百次自主实验重新设计了自己的推测性解码(speculative decoding)草案模型,将 token 生成效率提升了超过 15%。
OpenAI 使用其开源浮点精度检查工具 FpSan 验证了 Sol 重写的内核代码。这是业界首次有公开记录的生产级前沿模型自主重写自身推理栈,并将成果直接转化为面向客户的价格下调。用 OpenAI 博客的原话说:"这项工作仍在继续,形成了一个更紧密的反馈环:随着我们的模型不断改进并能更自主地工作,我们提升效率的能力也在加速。"换句话说,下一次降价可能来得比这一次更快。
回到模型本身。GPT-5.6 系列分 Sol(旗舰)、Terra(均衡)、Luna(快速经济)三档。这个命名是 OpenAI 刻意设计的产品线策略——不是一次性的版本号,而是 "可以各自独立进化的持久能力层级"。在降价之前,Luna 的价格已经只有 Sol 的 1/5;降价之后,差距拉大到了 25 倍。
但基准测试的差距远没有价格差距那么夸张。在评估 55 个专业领域长周期工作流的 Agents' Last Exam 上,Luna 得分 50.3,Sol 得分 53.6,相差仅 3.3 分。在 Terminal-Bench 2.1(命令行工作流)上,Luna 的 84.7% 对 Sol 的 88.8%。在 Artificial Analysis Coding Agent Index 上,Luna 的 74.6 对 Sol 的 80。
所有三项核心基准测试中,Luna 均为 Sol 的 90% 到 95% 水平,而价格是 Sol 的 4%。
更惊人的是性价比数据。根据 Trilogy AI 的计算,在 DeepSWE(真实代码库长周期工程任务)中,按降价前的价格,Luna 每美元 API 费用能产出约 24 个基准点,而 Claude Opus 4.8 是 4.5 个,Claude Fable 5 是 3.2 个。降价 80% 后,这个比值又提高了大约 5 倍。
按照 Artificial Analysis 的数据,Luna 的智能指数随推理算力投入从 26.6(无推理模式)上升到 51.2(max 推理模式),曲线陡峭。模型有潜力,但需要正确的推理预算。
但基准测试不能覆盖一切。Codex 用户们的真实体验,比任何一张排行榜都更复杂。
Sol 做规划,Luna 做执行:社区总结出的省钱公式
Peter Yang 推文下的 68 条回复形成了一份出奇一致的非正式测试报告。开发者们没有在争论 Luna 的基准数字,而是在分享同一套实战策略。
最乐观的声音来自有大型工作流验证的用户。Kun Chen(2.3 万粉丝的独立开发者)回复称:"在我最新的视频里,我用 Luna 从零到一构建了一个完整的 iOS app,大量浏览器自动化也都在里面跑。几乎分不出它和 Sol 的区别,除了一些技术判断需要我介入。"Jack Vinijtrongjit(Saakuru Labs 联合创始人兼 CTO,8.4 万粉丝)做了一个极端测试:两个任务在 Luna Max Fast 上连续运行一小时,仅消耗了周限额的 1%。按这个比例推算,"能跑大约 56 小时的任务,关掉快速模式就是 112 小时。"
最多的声音来自实用主义者,他们总结出了一套几乎一致的公式:Sol 做规划,Luna 做执行。用户 dipo(4100 粉丝)这样描述自己的 workflow:"我让 ChatGPT 里的 Sol 先做规划,然后把详细指令交给 Luna。多了一步,但聊天不消耗额度,Luna 在清晰指令下执行得非常好。"Morgan,一位资深云架构师,搭建了"基于角色的 Sol 编排层,让 Luna 子代理跑任务——我的额度终于能撑过两天了。"Vynce,一位新加坡开发者,报告 Luna Max Fast 在成熟的技能文件支持下,完成了涉及多标签页操作、文字输入和截图上传的 bug 报告工作流,"比 Sol Medium 稍慢,但用量不到 1%,而 Sol 要 2-3%。"
怀疑派指出了 Luna 的真实短板,但这些批评比单纯的否定更有建设性。
Byte Man 报告 Luna "在多步骤跨工具调度任务上失败得很惨,直接搞崩了我整个仓库,花了 48 小时切回 Sol Medium 修复。"Nikhil Shahane 的判断最精炼:"需要思考的地方就会翻车。它会暴力硬闯,但过程让人痛苦。"
Mykyta Pavlenko(乌克兰的 AI 产品经理)的建议最具实操性:"我不会把那 50% 的浏览器自动化量从 Codex 移走。你应该先测 Luna 能不能在遇到意外页面状态时不重启任务就恢复过来。"
Bailey Spell,一位旧金山的创业者,给出了最清晰的总结:他的团队"已经在生产环境中用 Luna Max 跑浏览器自动化",但效果"取决于任务定义得有多清楚。"用户 DefundWoke 提供的判断框架被多人引用:"如果任务能明确定义,不需要在执行过程中做太多判断,就没问题。超出这个范围,你就会看到问题。更好的做法是修改配置,让 Sol 编排 Luna Max 作为子代理来跑任务。"
Luna 现在比 Kimi K3 还便宜,但它不是最便宜的
OpenAI 的降价不是孤立的商业行为。自 2026 年 2 月以来,美国公司在 OpenRouter 上路由到中国模型(如 DeepSeek、Moonshot AI 的 Kimi K3)的 token 占比每周都维持在 30% 以上。据 CNBC 报道,Kimi K3 发布时在多项行业基准上超越了美国前沿模型,直接触发了硅谷的应激反应。
降价当天,Anthropic 同步发布了 Claude Opus 5,定价与 Opus 4.8 持平($5 / $25),但性能接近其旗舰 Fable 5 水平——本质上是在按性能计价而非直接降价。Google 在一个半星期前推出的 Gemini 3.6 Flash 定价为 $1.50 / $7.50,价格高于 Luna,但 Google 强调其 token 效率更高,agent 工作负载的实际任务完成成本可能低于标价。
根据 VentureBeat 整理的 API 价格对比表,Luna 的 $1.40(输入+输出合计)已经低于 Google Gemini 3.5 Flash-Lite 的 $2.80 和 Gemini 3.6 Flash 的 $9.00。在 OpenAI 系列内部,Luna 的价格断层更加显著——它比自家的 GPT-5.4($17.50 合计)便宜了超过 10 倍。小米的 MiMo-V2.5 Flash($0.40)和 DeepSeek V4 Flash($0.42)在纯 token 价格上仍低于 Luna,但性能不在同一个量级。Artificial Analysis 的智能指数显示,即使是最低推理设置的 Luna,其性价比已经全面压过了 Google 的两个主力模型。
三家巨头的策略泾渭分明:OpenAI 直接砍 token 单价,Google 通过减少 token 用量来降本,Anthropic 保持定价不变但提升单位价格内的性能。但三方瞄准的是同一个指标:完成一项生产任务的总成本,而非 token 的标价。
下一次降价,Sol 可能已经替你写好了代码
Peter Yang 的推文之所以引发共鸣,不是因为他在问一个陌生的新模型能做什么。他在问一个熟悉的旧模型——Sol——是否还有必要继续用。
对于 Codex 用户,答案已经清晰:Luna 不再是"玩具档"。在任务定义清晰、技能文件成熟的前提下,它能以 Sol 1/25 的成本交付接近 Sol 质量的产出。聪明的用法是混合编排:Sol 负责规划和决策节点,Luna 负责执行和批量操作。
但更大的叙事在降价背后:OpenAI 刚刚证明了前沿模型可以让自己的运行成本变得更低。如果 Sol 能在三周内靠自我优化砍出 20% 的推理成本,那下一次迭代的降幅可能不再是 80%,而是直接把 Luna 推进"便宜到不值得计量"的区间。Michele Catasta(Replit 总裁兼 AI 负责人)的评论可能是对 Luna 定位最精准的概括:"这是我见过的最便宜的、同时又如此强大的模型。它正在解锁我们在 Replit 原本以为很久以后才会去构建的用例。"
参考链接: