AREX Feed Article
腾讯混元Hy ASR 3.0上场:三语种错词率压至3%,语音识别开打"语义战"
阿里刚发完语音模型,腾讯四天后就掏出了Hy ASR 3.0
2026年8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。,该模型基于最新一代大语言模型Hy3。腾讯混元称,这是首次将Hy3的语义理解能力与高精度语音识别融合,使语音识别从"逐字转写、单点优化"演进为"理解语境、兼容场景、一键直出"。
四天前的7月31日,阿里巴巴刚发布Qwen-Audio-3.0-ASR-Flash,主打上下文一致性、行业词识别和热词定制化。。一周之内两大云厂商相继亮剑语音识别。
腾讯混元公布的开源评测集数据显示,Hy ASR 3.0 preview中文普通话词错误率(WER)为3.34%,英语2.62%,粤语3.12%,多语种整体约3%。,在自建评测集上,该模型在通用识别、方言识别、上下文理解及高噪耳语等复杂场景中的WER亦"整体领先竞品"。
目前模型已上线,腾讯元宝App完成首发接入并免费开放。,WorkBuddy等产品也在陆续接入中。
开发者真正在意的是:热词注入能不能省一轮校对?
腾讯混元官方英文账号发布Hy ASR 3.0 preview的获得450次点赞和28次转发。推文称模型在通用识别、上下文感知、多场景鲁棒性和方言覆盖四个维度"领先"。
X平台用户在第一时间发布了详细拆解,指出模型"会结合整段话判断同音词,不再只根据单个词的发音转写",并提到训练数据"覆盖数千万小时语音,以及10大方言片区和20多个细分片区"。
认证用户、汽车工程师从实用角度提出检验标准:"拿一段术语密集、有人打断或环境嘈杂的录音试试:要是校对能少做一轮,才算真的省时间。"这番评论点出了开发者对热词注入和上下文纠错能力的务实期待——跑分好看只是入场券,省下实际工时才是硬指标。
语音识别正在被LLM重写
语音识别赛道上一次标志性升级还要追溯到2024年上半年。彼时腾讯云推出了"语音识别大模型V1.0/V2.0",核心卖点是扩大模型参数量以提升噪声和远场场景下的准确率。,2024年3月的V2.0版本已实现"一个引擎同时支持中文普通话、英语、中文27种方言的混合识别"。
但当时的升级逻辑仍然是"更大的模型→更准的转写"。转折发生在2025年下半年至2026年。腾讯混元Hy3于2026年7月6日。随着大语言模型能力迭代,将LLM的语义理解能力注入ASR管线,成为新的技术方向。
阿里7月31日的Qwen-Audio-3.0-ASR-Flash强调"上下文一致性、行业词识别和热词定制化"三个维度;腾讯四天后发布的Hy ASR 3.0 preview则主打"理解语境、兼容场景、一键直出"。两家的关键词高度重合:上下文、热词、语义消歧。ASR的竞争维度已经变了。
Hy3做语言大脑,自研Encoder练了数千万小时
Hy ASR 3.0 preview的能力提升来自三个层面的技术积累。
架构层面:MoE+Hy3+自研语音Encoder。,模型采用MoE(混合专家)架构,基座升级至Hy3大语言模型。语音侧搭载自研无监督语音Encoder,通过数千万小时级无监督语音数据训练,从复杂音频中提取高质量的声学表征。
联合训练与多阶段能力注入:语音Encoder与大语言模型进行联合训练,引入覆盖多种方言、口音和声学环境的数千万小时语音数据。在联合预训练基础上,通过多阶段能力注入逐步获得上下文感知、复杂场景适应和方言识别能力。
后训练:高质量SFT+多阶段强化学习。模型构建了覆盖上下文、专业名词、不同声学环境和多样人群的高质量SFT数据,方言SFT体系覆盖10大方言片区和20余个二级小片区。在此基础上引入多阶段强化学习,分别针对通用转写准确性、上下文能力和复杂长尾场景进行优化。
值得注意的是,当前为"内测版本",仅支持1分钟以内语音、16k单声道PCM格式,暂不支持话者分离、VAD等功能,热词和上下文传入功能"即将开放体验"。
一周两场ASR发布,竞争从比准确率变成了比理解力
2026年8月之前,中国智能语音市场的竞争主轴仍然是识别准确率——谁的WER更低,谁就赢得客户。各大云厂商围绕中文普通话、方言、中英混说等场景持续优化引擎。
但阿里和腾讯在7月底、8月初的接连出手,标志着竞争逻辑的切换。两家都不再将"WER又降了多少"作为唯一卖点,而是把"上下文理解""意图捕捉""热词注入"推到了前台。明确将"context awareness"列为四大核心能力之一。
这一转向的背后是大语言模型能力的溢出。当LLM能够理解整段对话的语义、消解同音词的歧义、根据前文推断后续术语时,ASR就不再是一个孤立的声学模型,而是"LLM+声学"的联合系统。Hy ASR 3.0 preview的架构——联合训练语音Encoder和Hy3——正是这一趋势的典型实现。
对开发者而言,这意味着接入ASR API不再只是获得一串文字输出,而是拿到了经过语义理解校准后的结构化结果。但的"内测版"标注也提醒市场:从Demo到生产级服务之间,仍隔着功能完整性和稳定性两道坎。
Preview之后,语音交互的"理解层"开始成型
Hy ASR 3.0 preview 的"内测版"身份表明,腾讯混元还在试探这条路能走多远。1分钟的限制、话者分离和VAD的缺失,都说明这不是一个可以直接铺到生产环境的产品。
但它释放的信号足够清晰:语音识别不再满足于做输入法背后的听写工具。当ASR开始理解上下文、修正同音词、识别用户意图,它就变成了AI产品理解用户的第一层入口。从阿里到腾讯,一周之内两场ASR发布指向同一个方向——接下来要看的是,谁先把Preview变成Production。