AREX Feed Article
Google 官宣 Gemini 3.5 Transcribe 上线 macOS 版 Gemini 应用,语音加屏幕上下文直接干活
9 月 8 日(北京时间 9 月 9 日凌晨),Google Gemini 应用官方 X 账号 发推宣布:语音转文字模型 Gemini 3.5 Transcribe 现已可在 macOS 版 Gemini 应用中使用。推文称,用户可以借助语音和屏幕上下文,用自然语言总结本地文件、做规划与研究,以及创建图像。
这款模型被 Google 称为其最新、专为“精确、智能的实时转写”设计的 speech-to-text 模型。按官方博客给出的口径,它在流式转写场景下的平均词错率(WER)为 4.0%。不过需要说明,功能可用性、能力描述和性能数字目前均出自 Google 官方发布,尚无第三方独立验证。
模型半个月前就发布了,这次新增的是 macOS 客户端
Gemini 3.5 Transcribe 本身并不是首次亮相。8 月 26 日,已经介绍过这款模型,称它是“迄今最精确的语音转文字模型”(这是 Google 的自我评价),能把原始音频直接转成准确、润色过、带格式的文本,可以处理口语中的自我修正(比如“我们周二见——不对,周三”),过滤“嗯”“啊”之类的填充词,并自动排版。
9 月 8 日这条推文的增量在于消费端落地:它明确宣布该模型已进入 macOS 版 Gemini 应用。同一条推文串里,。按博客的说法,此前已有消费者通过 Android 上的 Rambler 功能和 macOS 版 Gemini 应用用上这套转写能力,这次官宣把 macOS 应用作为该模型的最新落地入口公布出来。
语音加屏幕上下文,背后调用其他 Gemini 模型
macOS 版的具体机制,博客写得比较直白:3.5 Transcribe 先把用户的自由口述转成干净的格式化文本,同时支持语音指令与屏幕上下文配合,驱动更复杂的工作流。当任务超出转写本身时,模型会通过 function calling(函数调用)把图像生成、文件分析这类活儿交给其他 Gemini 模型在后台完成——博客注明,这一能力目前只在 Gemini macOS 应用中开放。
落实到操作层面,官方给出的例子是:只用说话,就能总结本地文件、把文字跨应用改写复用,或在光标位置直接生成图像;推文则补充了“规划与研究”这个场景。重活由其他模型分担,转写模型在这里实际上承担的是 macOS 端语音入口的角色。
性能数字全部来自 Google 的口径
性能方面,Google 博客列出的数据是:按 Artificial Analysis 的测量,Gemini 3.5 Transcribe 在流式场景平均词错率 4.0%,非流式场景 2.6%;在覆盖主要语言和地区的 FLEURS 基准上,流式词错率 5.50%,非流式 5.04%,均优于上一代转写模型 Chirp 3;“到最终转写完成的时间”比 Chirp 3 缩短 70%。博客称该模型在嘈杂的真实环境下表现稳定,能准确识别邮编、订单号这类字母数字组合。
其他规格包括:自动检测并转写超过 85 种语言,支持自定义词表以识别专业术语和特殊拼写;对预录音频可做最多三位说话人的区分和词级时间戳(三位以上说话人为实验性功能)。这些数字和规格同样来自 Google 引用 Artificial Analysis 的官方口径,Google 同时强调“最精确”是它对自家模型的定位。
两条 API 通道,Google 把同一模型开放给开发者
除了 macOS 应用,Google 在 8 月 26 日的发布中已经把模型开放给开发者,走两条 API 通道:一条是经 Live API 使用 gemini-3.5-transcribe-live,提供双向实时流、亚秒级延迟,面向交互式语音应用;另一条是经 Interactions API 使用 gemini-3.5-transcribe,处理会议录音、通话记录等预录音频,带说话人归属和词级时间戳。
目前模型以公开预览形式进入 Gemini API(通过 Google AI Studio 和 Google Antigravity),企业侧则通过 Gemini Enterprise Agent Platform 使用,并将陆续登陆面向客服场景的 Gemini Enterprise。博客还列出一批借助 Gemini Live API 接入的语音开发平台:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents;vivo、Intellitek Health 和 Lingopal 三家公司给出了关于延迟、准确率和语言覆盖的正面反馈——这些反馈由 Google 转述,并非独立评测。
评论区在问 Windows 版,官方列出的入口里没有它
推文发布后数小时内获得约 7.1 万次浏览、615 次点赞(X 平台公开数据),回复区里最集中的诉求与 macOS 无关:多位用户追问 Windows 版何时到来。用户 Luke Litowitz(其 X 资料标注为产品分析师)在中写道:“还是让我惊讶的是没有 Windows 应用。”类似的问题在回复区反复出现,例如用户 Harshith 直接问。而按博客列出的落地清单——macOS 版 Gemini 应用(英文)、Android 的 Rambler(部分国家和地区)、即将推出的 Chrome——Windows 确实不在其中。
也有用户指出了实际使用中的门槛。账号 ProclaimLight 在中抱怨,Gemini Mac 应用强制要求允许屏幕录制,而他不想开放屏幕上下文;用户 AmineTX 则,他试过一次用语音操作 Gmail,当时没意识到说话时要按住 Function 键。屏幕上下文既是这次功能的卖点,也是用户提出隐私顾虑的地方。按官方口径,下一个明确的落地节点是 Chrome——Google 承诺届时可以在任意网页输入框里“说话即输入”,具体时间表尚未给出。