AREX Feed Article
Google AI 周末回顾:Gemini 3.8 Live 系列发布,称其为迄今最先进的实时对话音频模型
北京时间 9 月 19 日凌晨(美西时间 9 月 18 日上午),Google AI 官方 X 账号发布了一则,把 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 列为第一条更新,称两者是「我们迄今最先进的实时对话音频模型」。帖文随后列出其余四项动态:Google Labs 的个性化故事实验 Dreambeans 转为正式可用(GA),Google Labs 的 CC 从个人效率工具扩展为帮助家庭与住户协调日程和日常事务的共享智能体,Google Workspace 的图像工具 Google Pics 已 GA,Google DeepMind 的基因组学交互平台 AlphaGenome Atlas 上线。
回顾帖对新模型的描述只有这一句评价;关于发布时间、可用范围与能力细节的说明,早在 9 月 15 日已经给出:宣布两款模型从当日起分批推送,标出上下文与输出上限、知识截止日期和已知限制。第三方评测机构 Artificial Analysis 也在 9 月 15 日发出:Extended Thinking(高推理档)以 82.6 分在其 Speech to Speech 指数上登顶。
两个版本的分工:流畅对话与边推理边说话
Google 把两款模型定位为两条路线。按 9 月 15 日博客的说法,Gemini 3.8 Live 面向规模化与成本效率,主打流畅对话和视觉理解;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,提供更强的推理与多步执行能力。两者都能在对话进行的同时,在后台执行工具调用与 API 请求:用户说完请求,模型先确认,任务完成后再把结果带回来。
按博客描述,3.8 Live 能近实时处理视觉输入,并在对话中自动识别、切换 97 种受支持语言;Extended Thinking 的特点是「边推理边说话」,先用「让我查一下……」这类口头提示确认收到请求,再用实时进展播报讲清多步后台任务的进度。Google 给出的演示场景包括把草图和语音反馈实时变成 React 组件、协调多步预订与异步函数调用,以及用语音生成商业计划和营销工具包。
模型卡给出了具体规格:两个型号都基于 Gemini 3 Pro,输入支持音频、图像、视频与文本,上下文窗口最高 128K token(词元),输出为音频与文本、上限 64K token,知识截止日期为 2025 年 1 月。Google 提示这两款模型可能出现幻觉、偶发缓慢或超时;音频透明度方面,Google 称其 AI 产品生成的所有音频都嵌有不可感知的 SynthID 水印。
Google 引用的分数与 Artificial Analysis 的评测数据
Google 博客援引的 Sierra τ-Voice-banking 结果显示,Extended Thinking 在该基准上的完成度为 35.1%。博客同时附上一张 ServiceNow EVA-Bench 图表,称两款模型在复杂工作流上兼顾准确率与对话质量,图注写明测试运行在 Gemini Enterprise Agent Platform 的 Live API 上。
Artificial Analysis 自己的帖子给出了各型号的名次:它评测了标准版 3.8 Live 与高推理档的 Extended Thinking(该型号支持可调节的推理强度);后者以 82.6 分在 Speech to Speech 指数登顶(该指数综合语音推理、代理性能与竞技场表现),领先 GPT-Live-1(Astra, medium)的 81.5 分与 Grok Voice Think Fast 2.0 High 的 81.3 分;标准版 3.8 Live 以 76.0 分排第五,与 Gemini 3.1 Flash Live High 的 71.5 分相比,Extended Thinking 高出 11.1 分,标准版高出 4.5 分。
单项成绩并不全是第一。Extended Thinking 在 Tau Voice 上以 68.6% 排名第一,领先 GPT-Live-1(Astra, medium)0.7 个百分点;但在 Big Bench Audio 的 97.7% 之前,还有 Qwen Audio 3.0 Realtime Plus 的 99.2%。Speech Agent Arena 里,标准版的偏好排第二(Elo 1,083),第一名是同门的旧款 Gemini 3.1 Flash Live(Elo 1,096);标准版任务成功率 93.2%,落后 Grok Voice Think Fast 2.0 High 的 94.6%;Extended Thinking 的偏好分是 Elo 990,任务成功率 89.1%。
评测还记录了时延与价格:Big Bench Audio 上,标准版生成首个音频的平均时延为 1.18 秒,Extended Thinking 为 1.35 秒,都优于 Gemini 3.1 Flash Live High 的 2.99 秒,但慢于 Grok Voice Think Fast 2.0 High 的 0.70 秒。输入音频按小时计价,标准版每小时 0.84 美元,在该指数中价格最低;Extended Thinking 为每小时 3.50 美元。
从个性化故事到基因组图谱
回顾帖的其余四项更新并不是同一周发布的,最早的可以追溯到 9 月 1 日。
Dreambeans 是 Google Labs 6 月推出的实验应用。称,它已面向美国所有账号(18 岁以上)开放,支持 Android 与 iOS;每天生成一组个性化故事,素材来自用户选择的 Google 应用,包括 Calendar、Gmail、Photos、Search、YouTube 以及新接入的 Gemini。连接 Photos 后,故事里还会出现用户与亲友的照片。
CC 的扩展细节在 9 月 17 日的中给出:CC 拥有自己的 Google 账号与独立权限模型,最多容纳 6 名成员;只读取每位成员主动分享的内容;每天早晨生成共享的「Your Day Ahead」简报,并连接 Calendar 与 Tasks 自动维护日程。Google 称它还能代填许可类 PDF 表单、整理开学购物清单、生成每周菜谱,运行在基于 Antigravity 代理框架和最新 Gemini 模型的隔离云电脑上。目前它是面向美国 18 岁以上用户的实验功能,网页与移动端可用;既有用户会收到升级邮件,新用户要加入等待名单。
Google Pics 于 9 月 1 日发布():基于 Nano Banana 图像模型,可生成图像并做对象级精修,支持图内文字编辑与翻译、多人协作、一次生成多个版本;既作为独立产品使用,也集成进 Slides、Docs,随后进入 Drive。推送对象是 Google AI Pro、Ultra 订阅者和多数 Workspace 商业客户。
AlphaGenome Atlas 发布于 9 月 8 日(),为人类基因组中约 90 亿个单字母变异的分子效应提供预测,并给出把 AlphaGenome 与 AlphaMissense 的预测压缩成一个数字的 AlphaGenome Variant Impact(AVI)评分。Google 称其数据集约 1 PB(拍字节),是 AlphaFold 数据库的 30 倍以上;平台通过网页门户、AlphaGenome API 和 Google Antigravity 技能提供,学术用途免费,商业用途将在 Google Cloud 推出。博文称,合作研究者已用它定位到与癫痫性脑病相关的 DNM1 变异,并用实验验证了预测。
推送路径:Search Live 和 API 先行,企业端为私有预览
回到两款音频模型,Google 列出的推送名单分几层:开发者在 Gemini API 与 Google AI Studio 就能调用两个型号;企业客户的入口是 Gemini Enterprise 的私有预览;普通用户可从 Search Live(3.8 Live)与 Gemini Live(Extended Thinking)使用,Workspace 里再分层开放:Docs 面向 Google AI Pro 与 Ultra 订阅者,Gmail 和 Keep 面向所有 Google AI 订阅者。模型卡还把 Google Cloud 与 Vertex AI 列为分发渠道。
开发侧,Google 称 Agora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等实时交互平台已通过 Gemini Live API 支持这些模型,Salesforce、Genspark、Lumeris 等公司在接入。
在回顾帖的回复里,,当时距模型公布已过去三天,自己的账号中仍没有出现这两款模型。对 Gemini Enterprise for Customer Experience 与 Workspace 商业客户,Google 的用词是「即将推出」。