AREX Feed Article
xAI 官宣 Grok Voice Think Fast 2.0:0.70 秒首音、每分钟 $0.08
7月29日,xAI 官方 X 账号 推出下一代语音模型 Grok Voice Think Fast 2.0,称其在智能水平、转写准确率与对话能力上都有提升,即日起通过 API 与 Voice Agent Builder 提供,定价每分钟 $0.08。同日发布的把它称为"迄今最强的 speech-to-speech 语音模型"。
公告给出的硬数字:0.70 秒出首音,上一代是 1.25 秒;综合语音质量指数 82.9%。xAI 还把 2.0 放上 Starlink 客服热线做 A/B 测试,称销售转化率与自助解决率显著提升。
公告配图:与竞品模型的 speech-to-speech 基准对比表,底部标注数据来源为 Artificial Analysis。
第三方拆榜:总榜第 2、τ-voice 第一、名字被吐槽
独立评测机构 (@ArtificialAnlys,12.7 万关注者)在宣布当天发帖拆解:Grok Voice Think Fast 2.0 的 High 推理版本以 82.9% 位列其 Speech to Speech Index 第 2,仅次于阿里 Qwen Audio 3.0 Realtime Plus 的 84.1%,高于 GPT-Realtime-2.1 High 的 79.1%。
在 τ-voice 客服场景完成率榜上,它以 56.5% 登顶,超过 Qwen 的 54.6% 和上一代 1.0 的 52.1%。速度是单项强项:0.70 秒首音,是该项指数前五名中唯一平均首音延迟低于 1 秒的模型,第二名 GPT-Realtime-2 High 要 1.14 秒。
AA 还算了价格:每小时音频 $4.80,比 Qwen 的 $4.42、GPT-Realtime-2 High 的 $4.14 都贵,但比 GPT-Realtime-2.1 High 的 $10.75 便宜约 2.2 倍。
评论区另一种声音指向名字。德州账号 (9.4 万关注者)在原帖下留言:"能起个比 Grok Voice Think Fast 2.0 更好的名字吗?"AI 简报账号 把价格和延迟连起来读:"每分钟 $0.08 的音频,延迟正在变成一种产品决策。"
的概括更直接:"语音 Agent 不再是演示了,它们正在被用受控实验优化收入。"原帖发布至今累计约 984 万次浏览、8000 余次点赞。
上线刚四周,Voice Agent Builder 就换了新引擎
7月1日,xAI 发布 :无代码搭建语音 Agent 的平台,当时的主推价就是每分钟 $0.05。7月6日,官方账号从 @xai 。7月7日,API 。
2.0 出现在这条语音产品线启动后不到一个月。当前 上,"亚秒级延迟""25+ 语言""$0.05/min"仍是主推卖点,页面里的 τ-voice 榜单挂的还是 1.0。这次 2.0 定价 $0.08/min,比 Builder 上线时高出 60%。
0.70 秒首音:边说话边推理,token 用量压到 0.4 倍
Think Fast 系列的机制是边说话边推理:推理与语音生成并行,因此增加思考不拖慢响应。xAI 称 2.0 把推理 token 用得更省,P50 相对用量只有 1.0 的 0.4 倍,生产环境里工具调用通常在 Agent 第一句话说完前就已执行。
转写是这次升级的另一半。xAI 称在 24 种语言的数千条短句评估中,词错率相对 Deepgram Nova 3 与 ElevenLabs Scribe v2 改善 1.5–2.0 倍,相对 1.0 改善 1.4 倍;在噪声场景下与专用转写模型的差距拉大到约 10 倍。官方公告把目标场景写得很具体:嘈杂环境与电话压缩音质。
对话动态的涨幅最大:Full Duplex Bench 从 1.0 的 77.8% 升到 95.1%,AA 称这是总指数上升 7.3 个百分点的最大单项来源。xAI 博客给出的做法是强化学习,让模型学真实人类对话:句子更短、一次只问一个问题、不说废话。
涨价到 $0.08/分钟,附一份 Starlink 客服 A/B 数据
上一代 1.0 至今仍挂在 的语音价目表里:$0.05/min($3.00/hr),2.0 是 $0.08/min($4.80/hr),两代并列。涨价附带了生产数据:xAI 称在 Starlink 客服热线 +1 888 GO STARLINK 上做 A/B,销售转化率与自助解决率显著上升。
迁移也有时间表:8 月 5 日起,别名 grok-voice-latest 从 1.0 切到 2.0,现有调用无需改提示词;想继续用 1.0 的开发者需在切换前 pin 住 grok-voice-think-fast-1.0。切换日已过。
语音模型的记分牌,开始按转化率翻页
当一家公司发布语音模型时,同时公布客服热线的转化率 A/B 数据;评测机构把"能不能接住一通客服电话"做成 τ-voice 排行榜——语音模型就从会说话的演示,变成按经营指标计分的岗位竞争者。
0.70 秒首音、每分钟 $0.08、Starlink 转化率,是同一张记分牌上的三项。采购方要回答的问题是:省下的人工,值不值每分钟 $0.08。