AREX Feed Article
GPT-Live-1 登顶 Artificial Analysis Speech to Speech Index:Astra 档 81.5 分,Big Bench Audio 落后 Grok 与 Qwen
独立评测机构 9 月 15 日在 X 上公布了对 OpenAI 全双工语音模型 GPT-Live-1 的评测结果:在 Speech to Speech Index(语音到语音指数)上,GPT-Live-1 搭配 Astra(中推理档)后端以 81.5 分排名第一,搭配 Sol(低推理档)后端以 80.1 分排名第三,Grok Voice Think Fast 2.0 High 以 81.3 分夹在两者之间。
两个配置包揽了智能体基准 Tau3 Voice 的前两名,但在语音推理基准 Big Bench Audio 上落后于 Grok 与 Qwen;Artificial Analysis 在中补充,两个配置的分数目前仅基于一次试验。
指数由四个等权分项构成,四项齐全才上榜
Artificial Analysis 的 Speech to Speech Index 目前为 v2.0 版本:语音推理(Big Bench Audio)、智能体表现(Tau3 Voice)、竞技场偏好(Arena Score)、任务成功率(Task Success Rate)四个分项各占 25% 权重(见 ),模型必须在四项上都有有效结果才会进入指数。其中,竞技场偏好由盲测投票的 Elo 换算成 Arena Score,任务成功率统计的是模型在真实对话里做出正确最终工具调用的比例。
该指数在 6 月上线,8 月更新到 v2.0 时用任务成功率替换了对话动态(Full Duplex Bench)分项;对话动态以及延迟、成本等指标仍会在榜单上单独列出,不计入指数。
Artificial Analysis 称,GPT-Live-1 首次登上该指数便排名第一。
被评测的是「全双工语音层 + 后端文本模型」的组合
按 Artificial Analysis 的描述,GPT-Live-1 能在保持对话的同时,把推理和工具调用委派给后端的文本模型:开发者通过 API 持续输入音频、接收语音,后端模型单独配置。这次评测覆盖了两种后端配置:Astra(中推理档)与 Sol(低推理档)。
OpenAI 于 9 月 10 日,并称它可以委派给 GPT-6 Astra 这类后端文本模型,还把「打断处理」列为主要强项:同一个模型同时处理输入与输出音频,可以避开 STT-LLM-TTS 串联架构的延迟与交接问题。
Tau3 Voice:67.9% 与 59.3%
在 Tau3 Voice 上,Astra 档得 67.9%、Sol 档得 59.3%,Grok Voice Think Fast 2.0 High 以 56.5% 列第三。Artificial Analysis 在后续说明中表示,正是这一项支撑起 Astra 档的整体指数领先。
这项基准测的是端到端客服任务:模型要在航空、零售、电信等场景中完成多轮对话并正确调用工具,成绩按 pass@1 计算;Artificial Analysis 的实现基于 Sierra 的 τ-Voice 基准。
人类盲测的 Speech Agent Arena 给出的是另一组名次:Sol 档以 1,053 Elo 在偏好上排第三、任务成功率 90.9%;Astra 档以 1,048 Elo 排第四、任务成功率 87.4%。偏好排名第一是 Gemini 3.1 Flash Live Minimal(1,096 Elo),任务成功率第一是 Grok Voice Think Fast 2.0 High(94.6%)。
Big Bench Audio:90.1% 与 89.0%
Big Bench Audio 包含 1,000 道音频推理题,取自 Big Bench Hard 的四个类别(形式谬误、导航、物体计数、谎言网络),每类 250 题。Astra 档在此得 90.1%、Sol 档得 89.0%,落后于 Grok Voice Think Fast 2.0 High 的 97.2% 与 Qwen Audio 3.0 Realtime Plus 的 99.2%。
对话动态(Full Duplex Bench 子集)上,两个配置分别为 94.9%(Astra 档)与 97.3%(Sol 档);Artificial Analysis 说明该基准单独报告、不计入指数。
每小时 5.83 美元与 1.34 秒首音频
成本按固定的 Big Bench Audio 定价子集统计:Astra 档每小时输入音频 5.83 美元,Sol 档 4.47 美元,Grok Voice Think Fast 2.0 High 4.80 美元;GPT-Live-1 的数字包含委派给后端模型的使用成本。
Big Bench Audio 上的平均首音频延迟(Time to First Audio,TTFA)为:Astra 档 1.34 秒、Sol 档 1.24 秒,Grok 0.70 秒。
两个配置的强弱项不同:Astra 档在 Tau3 Voice 与 Big Bench Audio 上更高,Sol 档在成本、首音频延迟、任务成功率与竞技场偏好上更优。Artificial Analysis 的列出各配置的试验次数:GPT-Live-1 的两个配置各一次,GPT-Realtime-2(Minimal)一次,GPT-Realtime-2.1 High 两次。
回复区里的追问:成本差额与归因问题
评测帖的回复里, 把 Astra 档与 Sol 档的差额算成了具体数字:每小时输入音频贵 1.36 美元、首音频慢 0.1 秒、任务成功率低 3.5 个百分点。
用中文写道:「能对表是好事。不过它把推理甩给 Astra,语音层第一别直接当成整条链路都赢了。」
问的是这 1.34 秒首音频的构成:有多少是后端模型仍在推理时先发出的应答铺垫?