AREX Feed Article
OpenAI 把推理塞进 mini 语音模型,不涨价,xAI 六天前刚定 $0.05/min
一个周一的深夜,推理变成了语音 agent 的标配
7 月 6 日晚间,OpenAI 开发者账号悄然推送了一条更新:GPT-Realtime-2.1-mini 上线 API,推理能力和工具调用正式进入 mini 定价档位。
没有发布会,没有博客长文,只有一条推文和紧随其后的社区公告。但这条推文在 12 小时内斩获 2894 赞、176 次转发、27.6 万次浏览——开发者看懂了这行字的重量。
此前,Realtime API 的 mini 模型只能做基础的语音对话。如果想让语音 agent 在接电话时查订单、改预约、调 API,开发者必须选旗舰模型,音频输出 $64/1M tokens。
现在,同样的推理和工具调用能力出现在 mini 身上,音频输出只要 $20/1M tokens——价格一分没涨。OpenAI 显然在告诉语音 agent 的开发者:reasoning 不再需要预算审批。
"比旗舰便宜 90%,game-changer"——但评论区在催别的东西
独立开发者 Ben Badejo 第一时间发推:"输出 token 比 GPT-Realtime-2 便宜 90%,输入便宜 85%。绝对的 game-changer。VoiceClaw Realtime 明天就会更新。"这位已经把 2.1-mini 排进了自己的产品发布日程。
OpenAI 多模态 API 团队成员 Peter Bakkum 给出了更技术向的解读:"GPT-Realtime-2.1 虽然是增量更新,但字母数字识别——电话号码、邮箱——应该会有显著改善。" 这句话点出了生产环境中语音 agent 最容易翻车的场景:用户报一串编号,模型听错一个数字就是一次事故。
但评论区的主流情绪并非全是欢呼。AI 新闻账号 TestingCatalog 以 77 赞高票喊出了社区最集中的诉求:"We need Bidi 👀。" Bidi 是双向流式 API 的简称,开发者希望实现真正的全双工语音交互,而非当前的单向轮流模式。社区账号 Agent or Toy? 则调侃道:"reasoning in realtime AND cheap?? 他们真的就在一个周一晚上偷偷把这事干了 🔥。"
也有尖锐的声音。旧金山开发者 Damon Guzman 直言:"Realtime 系列在生产环境表现很差。不需要更便宜的模型,需要不拉胯的模型。做一个更大更聪明的,不要更便宜更蠢的。"另一位资深前端工程师 Evert Junior 补充:"贵得离谱,而且没人敢在生产环境信任它。"
ChatGPT 消费者端则继续声势浩大地刷着 #keep4o 标签——David Stark 在 OpenAI 开发者账号下高喊"听听你的用户吧",获得 29 赞。不过,#keep4o 是消费者端模型路由的争议,与 API 的 Realtime 产品线属于完全不同的战场。
六天前 xAI 刚给语音 agent 定了价,OpenAI 用推理反击
这次发布的时间点绝非随机。
7 月 1 日,xAI 正式上线 Grok Voice Agent Builder,以 $0.05/分钟的统一定价进入语音 agent 市场,免费赠送电话号码,每分钟额外加 $0.01 即可接入电话线路。该平台捆绑了 MCP 工具连接、安全护栏和可观测性面板,在 τ-voice 基准测试中以 67.3% 的成绩远超 GPT-Realtime-1.5 的 35.3%。一次性打包价 + 优势 benchmark,让 Grok Voice 迅速成为开发者社区热议的"语音新势力"。
再往前看,今年 5 月 7 日 OpenAI 发布了 GPT-Realtime-2、Realtime-Translate 和 Realtime-Whisper 三款语音模型,首次将 GPT-5-class 推理引入语音 agent。但那是旗舰 tier——推理语音的门槛依然高高在上。
六天之内,xAI 从价格端施压,OpenAI 从能力端反击。GPT-Realtime-2.1-mini 的发布本质上是一句回应:你们可以在分钟定价上卷,我直接把推理下放到最便宜的 tier,让你的语音 agent 不仅便宜,还能思考。
这已经不是语音模型的军备竞赛,而是语音 agent 定价模型的战争。
三个数字看懂这次更新:0 涨价、25% 降延迟、约 50 倍价差
这次更新的技术内核可以浓缩为三个数字。
第一个数字是 0。 GPT-Realtime-2.1-mini 的定价与上一代 GPT-Realtime-mini 完全一致:文本输入 $0.60/1M tokens、文本输出 $2.40/1M、音频输入 $10/1M、音频输出 $20/1M,缓存输入更是低至 $0.06/1M。加推理不加价,这是 OpenAI 罕见的"白送"操作。
第二个数字是 ≥25%。 OpenAI 在推文回复中单独指出,通过改进缓存机制,全系 Realtime 语音模型的 p95 延迟至少降低了 25%。p95 是第 95 百分位响应时间,捕捉的是用户真正感知到的尾部延迟——那一下"卡住"的感觉。这一刀直接砍在了语音体验最痛的地方。
第三个数字是约 50 倍。 GPT-Realtime-2.1 旗舰的文本输出 $24/1M、音频输出 $64/1M,而 mini 的对应价格是 $2.40 和 $20。更关键的是缓存定价:旗舰音频缓存输入 $0.40/1M,mini 只要 $0.06/1M——长会话的成本差距会迅速放大。explainx.ai 的测算显示,一条 5 分钟纯音频支持电话在 mini 上约 $0.007,而旗舰要 $0.21。
推理效率方面,OpenAI 建议大多数生产语音 agent 从 reasoning.effort: low 起步。low 档足够处理基础工具调用,medium 和 high 适合多步骤复杂流程,但会显著增加延迟和输出 token 消耗。这给了开发者一个精细的 trade-off 旋钮:简单任务不浪费算力,复杂任务可以手动加码。
旧格局是"便宜的不聪明,聪明的买不起",2.1-mini 把它撕了
GPT-Realtime-2.1-mini 发布之前,语音 agent 开发者面对的是一个清晰的二选一困境。
想便宜?用 GPT-Realtime-mini,$0.60/1M 文本输入——但没有推理能力,不能调用工具,遇到需要"想一想"的场景只能硬转文本 pipeline。想聪明?用 GPT-Realtime-2,推理能力和工具调用俱全——但音频输出 $40–64/1M,一条电话就可能吃掉可观的成本。
这次发布拆掉了这道墙。mini tier 现在拥有与旗舰同构的能力组合——可配置推理努力、函数调用、自然打断处理——而定价原地不动。
一位运营 24 个 AI agent 的独立创始人 Chad Justice 在推文中写道:"这是第一个真正的 realtime tier,一个 bootstrapped builder 能全天开着不心疼。60 美分每百万文本 token,10 美元音频输入。我不再因为价格说'不'。"
但墙拆掉的同时,新战场正在形成。xAI 的 $0.05/min 统一定价对语音 agent 运营商极其友好——不需要猜 token 消耗,不需要算音频时长,一个数乘以分钟数就是账单。不过需要注意的是,xAI 的分钟费之上,工具调用还要单独计费:文档搜索 $2.50/千次,网页搜索 $5/千次,电话线路再加 $0.01/min。两种定价模型的真实总成本取决于使用模式。
未来的语音 agent 格局不再是"谁能做 reasoning",而是"谁做 reasoning 的综合成本最低"。xAI 用分钟定价锁定了可预测性,OpenAI 用 token 定价加缓存折扣换取灵活性。这两种账本,将分别吸引不同类型的企业客户。
接下来比的不是谁能做 reasoning,而是谁做 reasoning 最便宜
GPT-Realtime-2.1-mini 的发布本质上传递了 OpenAI 对语音 agent 市场的一个判断:推理已经不再是差异化功能,而是基础设施。
当 mini 都能推理时,推理本身就不值得单独标价了。接下来的竞争焦点只有一个——在保持推理质量的前提下,谁能把每分钟的综合成本压得更低。xAI 已经亮出了 $0.05 的底牌,OpenAI 用 token 定价和缓存折扣回应。这场战争才刚刚开始,而赢家将是所有在深夜接到用户电话的语音 agent。
本文基于 OpenAI 官方公告、社区讨论及行业分析编写,数据截至 2026 年 7 月 7 日 12:00 UTC。
Sources:
- OpenAI Developers (@OpenAIDevs), X/Twitter, July 6, 2026 — (2,894 likes, 176 reposts, 276K views)
- OpenAI Community —
- MarkTechPost — , July 6, 2026
- explainx.ai — , July 7, 2026
- Mervin Praison — , July 7, 2026
- OpenAI API Changelog —
- eesel AI — , July 2, 2026