AREX Feed Article
Google 上线 Gemini 3.5 Transcribe:官方称迄今最精确的语音转文本模型
8月28日,Google 官方账号 发布本周新品盘点推文,把 Gemini 3.5 Transcribe 列在首位,称其为「迄今最精确的语音转文本(speech-to-text)模型」,旨在提供智能转写(intelligent transcriptions)。
两天前的 8月26日,Google 已在正式介绍这款模型,署名是 Gemini Audio 工程高级总监 Diego Melendo Casado 与幕僚长 Luke Leonhard。官方给出的「最精确」依据是:博客援引 Artificial Analysis 的评测称,模型流式场景平均词错率(WER)为 4.0%,非流式场景为 2.6%;相比上一代转写模型 Chirp 3,最终转写完成时间缩短 70%。
一条周更盘点,把转写模型列在首位
@GoogleAI 的推文以「本周发布了什么」开场,共列四项:Gemini 3.5 Transcribe、扩展视频生成与编辑能力的 Gemini Omni 1.1 Flash、加入 Daily Brief、Gemini Spark、Personal Intelligence 和 Gmail 收件箱管理等功能的 Gemini App Live 体验,以及从符合条件的 Google Play 电子书接入 Gemini Notebook 的 Expert Intelligence 计划。
截至 8月30日,这条推文已获得约 10.6 万次浏览和 851 次点赞。模型本身并非推文当天才亮相:8月26日的博客已给出完整发布细节,推文属于周度盘点,把本周上线的产品集中宣告了一次。
两套 API,把原始语音直接变成成稿
Google 在博客中说,传统语音识别模型往往难以应对背景噪声、复杂行话和表达不流利,Gemini 3.5 Transcribe 则直接把原始音频转成准确、整洁、带格式的文本。开发者可通过两套 API 调用:
- Live API(模型名 gemini-3.5-transcribe-live):面向交互式语音应用,提供亚秒级延迟的双向流式转写;
- Interactions API(模型名 gemini-3.5-transcribe):处理录音、会议和通话记录等预录音频,带说话人归因和逐词时间戳。
「智能转写」的机制包括:自动处理说话人的自我纠正(比如「周二见面——不,周三」)、删除「嗯」「啊」等填充词、自动排版;支持自定义词表识别专业行话和特殊拼写;自动检测并转写 85 种以上语言,兼容地区口音和方言,也支持语种实时切换。
预录音频的说话人归因最多支持三人,三人以上仍标注为实验性功能。模型还能通过函数调用把图像生成、文件分析等任务转交给其他 Gemini 模型,该能力目前仅在 Gemini macOS 应用内提供。
4.0% 词错率:「最精确」的数字依据
「迄今最精确」是 Google 自己的表述,依据来自两处数据。博客援引 Artificial Analysis 的测量称,模型流式平均 WER 为 4.0%、非流式 2.6%,在嘈杂的真实环境和邮政编码、订单号等字母数字实体上表现稳定;在 FLEURS 多语言基准上,流式 WER 为 5.50%、非流式 5.04%,均优于上一代 Chirp 3。
时间收益更直观:博客称,按 Artificial Analysis 的测量,从语音输入到最终转写文本的时间比 Chirp 3 缩短 70%。Google 没有给出 Chirp 3 的对应 WER 数值,也未说明评测数据集的具体构成。
从 Gboard 到 Chrome:落地路径与开放范围
模型已经进入 Google 的消费者产品。Android 版 Gboard 的 Rambler 功能用它把口语转成格式化文本、过滤填充词,还支持用语音修改、纠错和调整行文风格;Gemini macOS 应用(英文版)能用语音命令配合屏幕上下文,总结本地文件、跨应用改写文本、生成图片;Google Antigravity 在获得用户许可后结合屏幕上下文与聊天历史做转写;Google AI Studio 的 Build 模式支持用语音即时「边说边写代码」。Chrome 的网页输入框语音打字功能标注为 coming soon。
开放范围按人群区分:开发者可在 Gemini API(经 Google AI Studio 和 Antigravity)以公共预览形式调用;企业用户经 Gemini Enterprise Agent Platform 使用公共预览,Gemini Enterprise for Customer Experience 版本「即将推出」;普通用户目前可用 Gemini macOS 应用(英文)和部分国家与语言的 Android Rambler。博客称,消费者此前已通过 Gemini 应用和 Android 端的 Rambler 用上这款转写模型。
首批采用者:vivo、Lingopal 与七家开发平台
Google 博客列出了两类早期采用者。开发平台方面,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 基于 Gemini Live API 构建语音界面,由平台负责实时媒体流基础设施。
企业方面,Google 称 vivo、Intellitek Health 和 Lingopal 已给出积极反馈,重点提及延迟、准确性和语言覆盖。这属于 Google 单方面的转述。
Google 博客对 Chrome 只标注了 coming soon,没有给出上线时间;Rambler 也只写了「部分国家和语言」,没有列出开放清单。当前可以验证的事实是:gemini-3.5-transcribe 与 gemini-3.5-transcribe-live 两个模型名已随公共预览开放调用,官方所称的「最精确」,接下来要由开发者的实测数据来检验。