AREX Feed Article
StepAudio 3 以 1.7% 词错率登顶 Artificial Analysis 非流式语音识别指数,成为首个拿下该榜单第一的 StepFun 模型
独立评测机构 Artificial Analysis 北京时间 9 月 23 日凌晨(美国时间 9 月 22 日):StepFun 新发布的 StepAudio 3 ASR 以 1.7% 的词错率(WER,Word Error Rate,即转写文本中出错单词的占比,越低越好)登顶其非流式(non-streaming)语音转写 AA-WER 指数,前代 StepAudio 2.5 ASR 的成绩为 4.7%,相对降幅约 64%。Artificial Analysis 称,StepAudio 3 已可通过 StepFun API 进行非流式转写,并且是第一个登上这份非流式榜单头名的 StepFun 模型。
上述数字与排名均为 Artificial Analysis 的单方评测口径。在同一指数上,阿里巴巴的 Fun-Realtime-ASR-preview 同为 1.7%,两者实际并列;StepAudio 3 的胜出集中在语音 agent 对话音频,长音频是它的短板,价格则是最准确五款中最高的。
图:Artificial Analysis 2026 年 9 月 22 日发布的非流式 AA-WER 指数榜,紫色箭头指向 StepAudio 3 ASR(1.7%)。
占一半权重的对话音频把它抬上榜首
AA-WER v2 指数由三个数据集加权组成:语音 agent 数据集 AA-AgentTalk 占 50%,VoxPopuli-Cleaned-AA 和 Earnings22-Cleaned-AA 各占 25%,见 。Artificial Analysis 在中解释,StepAudio 3 的领先正来自偏 agent 用例的对话音频:在作为留出集(held-out)的 AA-AgentTalk 上,它的 WER 为 1.4%,领先 ElevenLabs Scribe v2 的 1.5% 和 Fun-Realtime-ASR-preview 的 2.0%;在 VoxPopuli-AA 上,它以 1.2% 与 Fun-Realtime-ASR-preview 打平。指数的一半权重落在对话音频上,StepAudio 3 最强的分项恰好在这里。
图:AA-WER 非流式分数据集对比(蓝:AA-AgentTalk;紫:VoxPopuli-Cleaned-AA;绿:Earnings22-Cleaned-AA),紫色箭头指向 StepAudio 3。
短板在长音频:Earnings22 上 2.8%,输给并列对手
在长篇财报电话会议数据集 Earnings22-AA 上,StepAudio 3 的成绩为 2.8%,落后于 Fun-Realtime-ASR-preview 的 1.8%——这是它三个分项数据集中最弱的一项,也是它与并列对手之间唯一落后的分项。一个技术细节侧面反映长音频的难度:按 AA 系列页面的注释,Earnings22 上无法可靠处理全长音频的模型会被分块送入评测,名单中列有按约 30 秒分块的前代 StepAudio 2.5 ASR,而 StepAudio 3 不在两组分块名单里。
88 倍实时、每小时 0.40 美元:准确率是用价格换来的
速度方面,AA 测得 StepAudio 3 的转写速度为 88 倍实时(speed factor,即每秒可转写 88 秒音频),低于 MAI-Transcribe-2 的 374 倍、Smallest AI Pulse Pro 的 285 倍和 Grok Voice Transcribe 2.0 的 154 倍,与 Gemini 3.5 Transcribe 的 91 倍、ElevenLabs Scribe v2 的 84 倍大致相当,但高于同为 1.7% 的 Fun-Realtime-ASR-preview 的 20 倍。
价格是另一面。StepAudio 3 定价 0.40 美元/小时,合 6.67 美元/1,000 分钟,在指数上最准确的五款模型(StepAudio 3、Fun-Realtime-ASR-preview、MAI-Transcribe-2、Scribe v2、Grok Voice Transcribe 2.0)中最贵:MAI-Transcribe-2 与 Grok Voice Transcribe 2.0 均为 1.67 美元/1,000 分钟,ElevenLabs Scribe v2 为 3.67 美元/1,000 分钟。前代 StepAudio 2.5 ASR 在同一页面上的价格为 0.37 美元/1,000 分钟,新模型单价约为其 18 倍。AA 把这组取舍概括为:以更高的每分钟成本,换取对话音频上第一梯队的准确率。
并列第一背后:两款模型在三个数据集上互有胜负
同为 1.7% 的两款模型,分项近乎互补:AA-AgentTalk 上 StepAudio 3 领先 0.6 个百分点,VoxPopuli-AA 上两者持平,Earnings22 上 Fun-Realtime-ASR-preview 反超 1 个百分点。按 50%/25%/25% 的权重折算,StepAudio 3 在对话音频上的领先贡献 0.3 个百分点,在长音频上的落后拖累 0.25 个百分点,两项大致相抵;AA 公布的指数分数里,两者同为 1.7%。这份榜单目前区分不出两名并列者,下一次指数更新时这两个分项数字的变化,是判断谁能单独占住第一的可核对节点。