AREX Feed Article
Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS:30 秒样本复刻声音,即日上线 Gemini API 与 AI Studio
2026 年 9 月 23 日,Google 通过宣布 Gemini 家族新增两款文本转语音(TTS)模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。两款模型即日起面向开发者在 Gemini API 与 Google AI Studio 上线;于同日 15:25:59 UTC(北京时间 23:25:59)发布公告帖,确认了发布主体与时间。
其中 Gemini 3.8 Flash TTS 主打生成式音色设计:用提示词描述角色、口音与声音特征,在 100 多种语言与方言里从零造出一个声音,另附 2,000 多个制作级音色可选;它还能基于 30 秒音频样本复刻声音,并配套同意验证、SynthID 水印与 C2PA 凭证。Flash-Lite TTS 则面向高吞吐、低成本的批量场景。
一款管角色创作,一款管规模化配音
按博客的定位,Flash TTS 为“深度创作指导与角色设计”而建,目标场景是游戏、沉浸式有声书、播客与互动媒体,支持对表演提示、节奏、方言切换与附和反应做逐行控制;Flash-Lite TTS 为高音量、低成本的规模化场景优化,覆盖大批量配音、音频内容生产与有表现力的语音代理,对语气、节奏与表现细节保留细粒度控制。
博客把这次发布描述为“将语音生成从静态预设变成动态创作工作室”,并称 Flash TTS 把可用音色从 30 个原始音色扩展成一个“无限音色库”。两款模型属于 Gemini Audio 家族——按博客的说法,这个家族正在快速扩张,此前已有 3.5 Live Translate、3.5 Transcribe、3.8 Live 与 3.8 Live Extended Thinking——它们也将用于改进 Gemini Notebook 与 Google Vids 的用户体验。
造一个声音的方式:提示生成、音色库与样本复刻
Flash TTS 的核心能力是生成式音色设计:通过自然语言提示定制角色、口音与声音特征。博客举的例子从“会喷火的戏剧化巨龙”到“带鲜明地方腔调的魅力旁白”,页面上的音频演示还包括墨尔本高能量 DJ 声、单薄单调的机器人声和一条日语巨龙。
不想从零设计的用户可以直接调用现成的制作级音色库,语言覆盖含墨西哥西班牙语、魁北克法语与苏格兰英语等地区变体。声音复刻只要求 30 秒样本——可以是用户本人的声音,也可以是有使用权的他人声音。设计好的音色可保存和管理,博客称以此保证跨项目的一致表现。
博客还预告了一个尚未上线的功能:音色重混音(Voice Remixing),从音色库挑一个声音,再微调音色、音高、语速与口音,比如用提示词“加一点淡淡的美国南方口音”或“让语气更柔和”。
逐行指挥表演,把笑声和“嗯哼”写进剧本
选定声音后,两款模型都支持对每句台词的演绎方式做精确控制:可以自己写舞台指示,也可以用自然剧本提示让模型接管——从平静的客服到压低声音的悬疑场景。长时生成可在数小时连续音频中维持音质、自然节奏与角色音色,博客称说话人漂移极小,并将其指向播客与有声书场景。
双说话人是原生能力:一份剧本直接排出多轮对话,两个声音分离清晰、话轮转换自然。剧本里还能写入非语言标记(<laughs>、<sigh>、<gasp>)与倾听附和(|mhm|、|yeah|),用于精确的喜剧节拍与反应点。
榜单成绩的两种口径:自报与可核对
Hume AI 榜单部分目前只有 Google 的自报口径:Gemini 3.8 Flash TTS 以 71.4 分位居 Voice Design Benchmark 总分第一,口音建模项以 60.8 分领先;在 Hume AI Overall Quality Index 上,Flash 与 Flash-Lite 分列第一、第二。对比上一代 Gemini 3.1 Flash TTS,博客称新模型在长时内容与双说话人剧本控制等用例上有大幅改进。本次报道无法独立复核这些数字——Hume AI 的 Real World Voice EQ 页面介绍了包含语音识别、语音理解、TTS 质量、实时语音代理、声音复刻与声音可控性在内的六类榜单框架,但可抓取的公开页面文本未直接呈现上述分数。
Voice Arena 部分可部分核对。博客称两款新模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语与印地语等语言的盲测中位居前列,这部分仍以博客口径为准;截至发稿,显示 Gemini 3.8 Flash-Lite TTS 以 1,087 分排名第一,Cartesia Sonic-3.6(1,068 分)第二,Gemini 3.8 Flash TTS(1,061 分)第三,Google 上一代 Gemini 3.1 Flash TTS(1,057 分)排在第五。
声音复刻的闸门:口头同意录音、SynthID 与 C2PA
声音复刻直接使用真实人声。按博客说明,创建复刻音色前,用户必须提供一份来自声音所有者的口头同意录音,且该录音须与参考说话人匹配,音色才能创建。范围更大的是水印:所有 Gemini Audio 模型生成的音频片段都织入 SynthID 不可感知水印,保持可检测性以帮助防止虚假信息——这是博客给出的理由。
博客把安全与责任细节指向官方。截至发稿,这张 2026 年 9 月 15 日发布的模型卡卡面内容围绕 Gemini 3.8 Audio 之下的 Live 与 Live Extended Thinking 两款实时音频模型展开,尚未为两款 TTS 模型单列条目。
上线的入口、集成的公司与还没上线的部分
开发者现在可以在 Google AI Studio 的语音设计工作台里从零提示全新声音、或复刻自己的声音,再把它们带进双说话人剧本编辑器逐行指导。Agora、LiveKit、Pipecat、Vercel 等开发平台已通过 Gemini API 提供接入。Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等公司正在集成新模型,按博客的说法,用途集中在加速全球配音、带地方口音的媒体本地化与规模化语音代理。
渠道进度方面:面向普通用户,Flash TTS 进入 Gemini Notebook,Flash-Lite 进入 Google Vids。加上音色重混音,博客标注 “Coming soon”(即将推出)的还有面向企业的 Gemini Enterprise 渠道,两项均未给出具体上线时间。