AREX Feed Article
阿里千问发布 Qwen-Audio-3.1 五款音频模型:新增 TTS-Next 与 ASR-Next,宣称 ASR 最高降价 95%
2026 年 9 月 23 日,阿里巴巴千问官方账号 宣布正式发布 Qwen-Audio-3.1 系列音频模型:既有三条产品线 ASR(语音识别)、TTS(语音合成)、Realtime(实时语音交互)全面升级,同时新增音频创作模型 TTS-Next 与音频理解模型 ASR-Next,合计五款,官方称其构成覆盖「理解—生成—交互—创作」的完整音频能力栈。该帖经 Twitter API 核实发布于 2026-09-23T09:11:23Z(北京时间 17 时 11 分),帖内附官方博客与 API 链接。
价格上,官方宣称全线下调:TTS 降价约 70%,Realtime 约 85%,ASR 最高 95%。同日,佐证了这次发布,并补充官方细节:ASR 支持 30 种语言与 16 种中文方言,TTS-Next 一次生成人声、音效与环境音,Realtime 全双工、可随时打断并调用 Agent 工具。
五款模型一次推出,帖内先开放 ASR 与 Realtime 两个 API 入口
按官方帖文,五款模型分别是 Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next 和 Qwen-Audio-3.1-Realtime。帖内给出的两个 API 入口分别指向 和 的千问云页面,两个链接在发稿时均可访问;帖文同时注明「更多 API 即将推出」,TTS、TTS-Next 与 ASR-Next 在发布帖中尚无可调用的入口。
帖内所附官方博客为,发稿时可正常访问,页面标题为「Qwen-Audio-3.1-TTS · Speech Synthesis」,内容围绕 TTS 一款模型展开。
ASR:分角色转写与原生润色,公开子集平均方言字错率 4.55%
据,Qwen-Audio-3.1-ASR 采用端到端结构化方案,把说话人标签、时间戳和文本联合输出,既能处理轮流发言,也保留短插话和重叠语音;一套模型支持 30 种语言和 16 种中文方言,并支持行业词、专业实体与分级热词识别,可参考长音频历史上下文,让人名、缩写和专业术语在全文保持一致。低延迟流式识别可边说边转写,官方给出的首字响应约 160 毫秒。新版还加入原生转写润色:自动去除语气词与重复表达、自我纠正并重组语义,让转写文本更顺畅。
官方给出的基准数字分三组:在 KeSpeech 和 WSYue 的 11 个公开子集上,Qwen-Audio-3.1-ASR 平均字错率(CER)4.55%,并在 6 个子集上取得最优结果;在官方自建的 16 种方言测试集上,它在 11 个方言子集取得最优,平均 CER 10.38%,其中温州话等较难方言提升明显;把方言语音翻译成普通话的 AST 测试中,它在 11 个子集中的 10 个上最优,平均语义句准率 82.10%。这些数据均由官方提供。
ASR-Next:识别对象从「语音中的文字」扩展到情绪与环境声
ASR-Next 是此次新增的两款模型之一。据官方帖文与官方介绍,这款基于下代架构的模型支持带说话人标签、时间戳和对齐转写的多说话人识别,并能理解人物情绪、环境声与机械声,完成声音描述(sound captioning)、事件定位、音频问答与推理。IT之家转述的官方例子是:面对一段同时包含人物对话、背景音乐和环境声的音频,模型除输出对话文本外,还能描述音频里有哪些声音、相关事件在何时发生,并回答与整段内容有关的问题。按官方的说法,ASR 处理的对象由此从「语音中的文字」扩展为「完整的音频信息」。
分角色识别能力方面,官方在四个测试集的八项指标中给出对比:Qwen-Audio-3.1-ASR-Flash-Next 取得五项最优、Qwen-Audio-3.1-ASR-Flash 取得三项最优,二者均优于此前的 Fun-ASR 级联系统。IT之家转载稿所附表格还列出了与 MOSS-Transcribe-Diarize、META 的 Muse-Voice-Transcribe-1.0 和 Google 的 Gemini-3.5-Transcribe 的对照,例如在 AISHELL-4 上,Qwen-Audio-3.1-ASR-Flash-Next 的说话人分离错误率(DER)为 2.73、按说话人拼接计算的词错误率(cpWER)为 14.17,两项均为表内最优。
TTS 与 TTS-Next:从合成语音到生成整段音频
Qwen-Audio-3.1-TTS 主打跨语言音色迁移:同一音色在不同语言间合成时保持自然,官方称可「秒讲数种语言」,并支持用简单指令控制情绪、语速和表达方式。官方博客给出了更多技术细节:模型采用 12.5 Hz 低帧率语音 tokenizer(把连续语音编码为离散单元的组件)降低推理延迟,训练管线为五阶段渐进式范式;新增 86 个细粒度内联标签,可在短语和词级控制笑声、呼吸、咳嗽、叹气等非语言事件;支持 16 种语言(其中 7 种为新增)与 20 个中文方言区,一次可生成长达 3 分钟的长音频,面对嘈杂、混响或含混的参考音频无需显式降噪模式即可稳定生成,并通过声码器超分支持 48kHz 输出。博客还称该模型在多项评测维度达到最优或最强综合结果,并在独立的 Artificial Analysis 文本转语音排行榜上排名第一。这些同样是官方自述。
TTS-Next 则不再局限于单一语音合成。官方帖文称它基于统一的语言模型与扩散模型(LM + diffusion)框架,围绕文本、时间戳和参考音频等输入,一次生成人声、音效与背景音,面向有声书、播客、游戏与广告场景。据 IT之家转述,它支持多人音色复刻与多轮对话生成,在连续内容中保持各角色音色,按脚本演绎情绪与节奏,避免多轮生成中角色「变声」,并呈现停顿、接话、附和、情绪转折等自然表达;多类声音融合时可呈现声音材质、远近变化与空间层次。官方以有声书为例:模型同时处理旁白与两位角色的对话,并生成城市低鸣、晚风和易拉罐碰撞声。用户可用自然语言指定说话人语气、语速、音量、音乐风格与配器,模型还支持细粒度时间戳控制、声音复刻与 48kHz 输出。
Realtime 会接话、会共情,正在接入 Qoder、千问办公与多款 AI 眼镜
Qwen-Audio-3.1-Realtime 的核心变化是全双工:同时说与听,用户可以随时插话、打断,官方称交流体验更接近真人通话。官方的概括是「听得更懂,更会接话,更会共情」:识别到用户语气低落时,它会放慢语速、调整措辞,而不是机械地回一句「我理解你的感受」;对话中切换语言时,模型保持此前的上下文、语气和节奏。
在任务执行上,Realtime 可在实时对话中调用工具,连接 API、知识库和业务系统完成搜索、查询或任务执行,再把结果带回对话;官方称其基于多教师蒸馏架构,在保持低延迟的同时提升理解、推理、表达与安全能力。落地方面,据 IT之家转述,Qwen-Audio-3.1-Realtime 正在与 Qoder、千问办公等 Agent,以及 QwenNote、A2、Eva、千问 AI 眼镜、乐奇 AI 眼镜等智能硬件结合,用户不必打开电脑或手机,直接通过语音发起任务,并在实时对话中继续追加条件或修改需求。
性能数字均为官方口径,开放权重与否尚无说法
文中出现的降价幅度与各项基准数字,全部来自千问官方帖文或官方提供的材料;IT之家报道本身亦属自媒体平台转载稿。到目前为止,没有第三方独立测试可以交叉验证这些数字,官方帖文也没有说明这五款模型是否开放权重。
另一个悬而未决的点是可用性:发布帖内只有 ASR 与 Realtime 两个 API 入口,TTS、TTS-Next 与 ASR-Next 的 API 按帖文说法「即将推出」。TTS-Next 与 ASR-Next 实际效果如何,要等这些入口开放、或有独立评测出现之后才能验证。