AREX Feed Article
Google DeepMind 上线 Gemini 3.5 Transcribe:WER 2.6%,85+ 语言自动识别
2026 年 8 月 26 日 17:00 UTC,Google DeepMind 官方博客发布新一代语音转写模型 ,称它是"迄今最精准的语音转写模型"。17:03 UTC,发推宣布上线并附演示视频;不到一分钟后, 亲自官宣,确认 API"现在即可使用"。
开发者可在 Gemini API(Google AI Studio)与 Gemini Enterprise Agent Platform 上以公开预览形式调用。博客由 Gemini Audio 工程高级总监 Diego Melendo Casado 与幕僚长 Luke Leonhard 署名,把"自动检测并转写 85+ 种语言、最多三位说话人归属、自定义词汇、去填充词、函数调用"列为核心能力。
按 Artificial Analysis 的测评,模型非流式词错误率(WER)为 2.6%、流式为 4.0%,最终转写时延较前代 Chirp 3 改善 70%。这些数字来自公司与第三方测评机构的声明,公开渠道尚未见更多独立复测。
自动改口、去填充词、识别三个说话人
模型按使用场景拆成两个接口:实时流式接口 gemini-3.5-transcribe-live 走 Live API,提供亚秒时延的连续双向流,面向语音 agent 等交互应用;gemini-3.5-transcribe 走 Interactions API,处理会议、通话记录等预录音频,输出说话人归属和词级时间戳。
转写之外,模型处理的是口语的"毛边":自动修正自我纠正(官方例子是"周二见面——不,周三")、删掉 "um""ah" 等填充词、自动排版。DeepMind 的补充说,它在嘈杂环境下也能抓准电话号码、邮政编码、订单 ID 这类字母数字实体,并可按开发者提供的词汇表识别行业术语和特殊拼写。
多说话人识别支持在预录音频中区分最多三位说话人,3 人以上标记为实验功能;函数调用目前仅在 macOS Gemini 应用中开放,可把图像生成、文件分析等任务转交给其他 Gemini 模型。
WER 2.6%、时延快 70%:数字的出处
博客引用的性能数字都标注了测量方:按 Artificial Analysis 的测评,平均 WER 为流式 4.0%、非流式 2.6%,"最终转写时延"(time to final transcription)较前代 Chirp 3 改善 70%;在 FLEURS 多语言基准的一组主要语言上,模型流式 WER 5.50%、非流式 5.04%,均优于 Chirp 3。
Pichai 的官宣帖没有附基准数据,只强调多说话人理解、85+ 语言自动检测和自定义词汇,提到自定义词汇时还补了一句 "SGTM:)"(听起来不错)。博客把 Chirp 3 称为"我们之前的转写模型",对比维度是"新能力、更低的词错误率和明显更好的时延"。需要分清的是:这些数字是 Google 引用 Artificial Analysis 测量的声明,并非独立验证的结果。
API 刚开放,Gboard 和 macOS 应用早已在用
博客透露,消费者端其实已经跑了一段时间:"在我们自己的产品里,比如 Gemini 应用和 Android 上,我们已经看到消费者从这一转写模型中受益"——Android Gboard 的新功能 Rambler 和 macOS Gemini 应用都基于它做语音转写。这次开放的是 API 侧:开发者经 Gemini API(Google AI Studio、Google Antigravity)公开预览调用,企业经 Gemini Enterprise Agent Platform 使用,后续进入 Gemini Enterprise for Customer Experience。
各入口分工不同:Gboard 的 Rambler 把口述转为排版好的文本、过滤填充词,还能语音改拼写、调文风;Antigravity 在用户许可下结合屏幕上下文与聊天历史保证转写准确;AI Studio 的 Build 模式支持语音"vibe coding";macOS 应用里的语音命令可结合屏幕上下文,后台调用其他 Gemini 模型完成摘要、跨应用改写和生成图片。
边界同样写在公告里:macOS 应用目前仅支持英文,Rambler 只在部分国家和语言上线,Chrome 的"在任何网页输入框语音输入"仍是"即将上线"。博客还列出了基于 Gemini Live API 接入的七家平台:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents。
平台方当晚表态,独立测试者搬出 Whisper 做对照
Google DeepMind Gemini 模型产品负责人(高级总监) 在官宣后发推:"如果你已经在 Android Gboard 或 Gemini Mac 应用里用过 Gemini 3.5 Transcribe,你会知道它是用语音办事的 game changer。我们现在正把这个能力带到 API。"她同时判断,语音会继续成为人们与 agent 交互的主要方式。
官方账号在 DeepMind 官宣帖下回复:"恭喜!我们很高兴在 visionagents_ai 中支持这个新模型。" 引述数据称模型"交出了非常强的语音基准",结论是"语音 AI 正变得又快又准"。开发者 则拿它与 OpenAI Whisper 做了对照:"这是主观的,但 Gemini 在英语和嘈杂环境的转写上表现更好,在西语和乌克兰语上也不落下风。"
唱反调的也有。 在引述帖下留言"根本算不上第一梯队"; 提醒:"词准确率基本已经解决了,生产环境里难的是串话、自然停顿和零延迟的结束语检测。"博客则列出 Vivo、Intellitek Health、Lingopal 三家公司的正面反馈,称其认可模型的时延、准确率和语言覆盖。
定价未公布,独立验证仍是问号
里,有网友直接追问"每小时定价是多少"。博客通篇没有给出价格,只写了三条接入路径:开发者与企业的公开预览、macOS 应用(英文)与 Rambler(部分国家)的现成入口,以及 Chrome 的"即将上线"。
官方引用的 WER 与时延数字出自 Artificial Analysis 的测量和 Google 自己的声明;到本文发稿为止,能看到的第三方验证还停留在开发者个人的主观测试。"迄今最精准"这个说法能走多远,目前只能由开发者自己拿音频去试。