AREX Feed Article
Gemini 3.8 Live 登顶 Artificial Analysis Speech to Speech Index:Extended Thinking (High) 82.6 分,GPT-Live-1 退居第二
9 月 15 日 21:44 UTC(北京时间 9 月 16 日 05:44),独立评测机构 Artificial Analysis(@ArtificialAnlys)在 称,Google 的 Gemini 3.8 Live 语音到语音模型中,Extended Thinking (High) 版本以 82.6 分首登该机构的 Speech to Speech Index(语音到语音指数)第 1,高于 GPT-Live-1 (Astra, medium) 的 81.5 分与 Grok Voice Think Fast 2.0 High 的 81.3 分。帖文还报告,该版本在 Tau Voice 智能体基准上以 68.6% 居首;标准版 Gemini 3.8 Live 的输入音频成本为 0.84 美元/小时,是该指数中最便宜的模型。
上一轮更新中位列第 1 的 GPT-Live-1 (Astra, medium) 这次退居第 2,GPT-Live-1 (Sol, low) 以 80.1 分列第 4。
榜单图表来源:Artificial Analysis 于 9 月 15 日发布的系列帖文。
标准版以 76.0 分列第 5,两个版本都高于上一代
Artificial Analysis 说,它通过 Gemini Live API 评测了 Gemini 3.8 Live 的标准版与 Extended Thinking 的 High 推理档。按帖文描述,Gemini 3.8 Live 是 Google DeepMind 的 Gemini 3.1 Flash Live 的继任者,可以在继续对话的同时在后台执行工具与 API 调用;其中 Extended Thinking 支持配置推理强度。
本轮榜单上,Extended Thinking (High) 以 82.6 分居首,标准版以 76.0 分列第 5;两个版本分别比上一代 Gemini 3.1 Flash Live High(71.5 分)高 11.1 分与 4.5 分。第 2 至第 4 名依次是 GPT-Live-1 (Astra, medium)(81.5 分)、Grok Voice Think Fast 2.0 High(81.3 分)与 GPT-Live-1 (Sol, low)(80.1 分)。
该指数由四项合成:Big Bench Audio 语音推理、Tau Voice 智能体性能、Arena 偏好与 Arena 任务成功率。
Tau Voice 高出上一代 30.9 个百分点,Big Bench Audio 列第 4
在 Tau Voice 上,Extended Thinking (High) 以 68.6% 居首,领先 GPT-Live-1 (Astra, medium) 的 67.9%、GPT-Live-1 (Sol, low) 的 59.3% 与 Grok Voice Think Fast 2.0 High 的 56.5%,比上一代 Gemini 3.1 Flash Live High 的 37.7% 高出 30.9 个百分点;标准版为 30.1%。该机构在 中标注,GPT-Live-1 (Astra, medium)、(Sol, low) 与 GPT-Realtime-2 (Minimal) 基于 1 次试验,GPT-Realtime-2.1 High 基于 2 次试验。
在 上,Extended Thinking (High) 得 97.7%,排在第 4,前面是 Qwen Audio 3.0 Realtime Plus 的 99.2%、Qwen3.5 Omni Plus Realtime 的 98.7% 与 StepAudio 3 Realtime 的 97.9%;它高于 Grok Voice Think Fast 2.0 High 的 97.2%,标准版得 91.7%。
Extended Thinking (High) 每小时 3.50 美元,两个版本首音频都不足 1.4 秒
Artificial Analysis 的成本口径是:完成固定的 40 题 Big Bench Audio 子集、按输入音频时长折算为每小时成本。标准版 Gemini 3.8 Live 为 0.84 美元/小时,是这张分表上最低的一条,约为 Gemini 3.1 Flash Live High(1.75 美元/小时)的一半;Extended Thinking (High) 为 3.50 美元/小时,低于 GPT-Live-1 (Sol, low) 的 4.47 美元/小时、Grok Voice Think Fast 2.0 High 的 4.80 美元/小时与 GPT-Live-1 (Astra, medium) 的 5.83 美元/小时,约为 GPT-Realtime-2.1 High(10.75 美元/小时)的三分之一。
时延上,Big Bench Audio 的平均首音频时间为 1.18 秒(标准版)与 1.35 秒(Extended Thinking (High)),优于 Gemini 3.1 Flash Live High 的 2.99 秒,与 GPT-Live-1 (Sol, low) 的 1.24 秒、(Astra, medium) 的 1.34 秒接近,慢于 Grok Voice Think Fast 2.0 High 的 0.70 秒。
盲测偏好:标准版 1,083 Elo,Extended Thinking (High) 990 Elo
Speech Agent Arena 让参与者与两个匿名模型进行实时语音对话,再选出更偏好的一个。标准版 Gemini 3.8 Live 以 1,083 Elo 列偏好第 2,仅次于 Gemini 3.1 Flash Live 的 1,096,高于 GPT-Live-1 (Sol, low) 的 1,053;其任务成功率为 93.2%,仅次于 Grok Voice Think Fast 2.0 High 的 94.6%。指数第 1 的 Extended Thinking (High) 在偏好上为 990 Elo,任务成功率 89.1%。
指数第 1 与偏好第 1 分属两个模型:指数由 Gemini 3.8 Live Extended Thinking (High) 占据,1,096 Elo 的偏好第 1 属于此前的 Gemini 3.1 Flash Live。
结果出自 Artificial Analysis 自建指数,Google 在发布博客中引用
这组数字由 Artificial Analysis 自行评测并发布,依托的是它自建的指数与它对 Tau Voice 的实现。对比涉及的配置为:Gemini 的标准版与 Extended Thinking (High) 档,以及 GPT-Live-1 的 Astra 档(medium)与 Sol 档(low);Gemini 两个版本之间的 Elo 差距是 93 分(1,083 对 990),Extended Thinking (High) 的小时成本约为标准版的 4.2 倍。
Google 在 9 月 15 日的官方博客中介绍了这两款模型(署名 Tom Ouyang 与 Malini Jaganathan),并引用了同一组结果中的三个数字:Speech to Speech Index 的 82.6 分、Tau Voice 的 68.6% 与 Big Bench Audio 的 97.7%(Google 在博客中称之为 Speech to Speech Quality Index),另外给出 Sierra τ-Voice-banking 的 35.1% 成绩。按博客说法,两款模型当天开始在 Gemini API 与 Google AI Studio 提供,标准版进入 Search Live,Extended Thinking 进入 Gemini Live 与 Workspace(Docs、Gmail、Keep,面向订阅用户);Google 还称,其 AI 产品生成的音频均嵌入 SynthID 水印。
企业方面,两款模型目前在 Gemini Enterprise 处于私人预览;Google 表示,面向客户体验场景的版本即将推出,Extended Thinking 还将面向 Workspace 商业客户提供。