AREX Feed Article
NVIDIA 赌开源语音 AI:首个全双工工具调用模型上架 HuggingFace,专有方案的优势还剩什么?
过去两年,语音 AI 的叙事被一条线划成了两半。线的一侧是 OpenAI、Google、xAI 的专有方案——GPT-4o Realtime 能打断、能调工具、能在对话中切话题,但你拿不到权重,也看不到里面在跑什么。线的另一侧是开源社区——Kyutai 的 Moshi 开了全双工语音的头,NVIDIA 自己的 PersonaPlex 把对话自然度推到了新高度,但它们都没有工具调用。你不光需要一个语音模型,还得在外面再搭一套 ASR→LLM→TTS 的级联管道,开发成本翻倍,端到端延迟翻倍,出错概率也翻倍。
8 月 3 日,NVIDIA 把这条线擦掉了。NemotronLabs VoiceChat 11B 正式以开放权重的形式上架 HuggingFace,成为第一个开源的全双工语音模型——同时支持自然轮替、用户打断和实时工具调用。
一个模型,四项能力:听、说、打断、调工具
VoiceChat 11B 要做的事很明确:把传统语音助手里 ASR、LLM、TTS 三块拼图合进一个模型,并且加一条工具调用的独立输出通道。
参数规模 11B,架构是混合 Mamba/Transformer。前端用 Fast Conformer 语音编码器处理输入音频,中间塞了一颗 Nemotron Nano V2 9B 语言模型做推理,后端接 TTS 解码器生成语音输出。工具调用脚本走单独通道输出,不影响语音生成流。
这意味着什么?开发者不用再维护三套模型的版本兼容、API 握手和延迟叠加。一个模型,一个推理进程,四项能力同时在线:听用户说话、生成回复语音、被打断时即时让出说话权、需要查天气或订机票时自动触发工具调用。
模型卡上两组延迟数字把体验感说清了。自然轮替响应约 450 毫秒,用户打断响应约 480 毫秒。作为参照,人类对话中轮替间隔通常在 200-500 毫秒之间。VoiceChat 落在了这个区间里。
训练数据规模约 55 万小时,覆盖真实录音和多种 TTS 系统生成的合成语音。授权协议是 OpenMDW 1.1,限定研究用途。
450 毫秒响应、480 毫秒中断:VoiceChat 是怎么做到的?
VoiceChat 的技术路线可以概括为"端到端一体化 + 独立工具通道"。它不走级联方案的老路,而是把整个语音交互流程塞进一个统一模型。
全双工:同时听、同时说
传统语音助手的级联链路大致是这样:用户说话 → ASR 转写成文本 → LLM 生成回复文字 → TTS 合成语音 → 播给用户。每一步都是串行的,每一步都在积累延迟。更致命的是,这个链路天然是半双工的——模型在"听"的时候不能"说",在"说"的时候不能"听"。
全双工模型从根本上改变了这一点。VoiceChat 用 Fast Conformer 编码器持续接收音频流,LLM backbone 同时处理理解和生成,TTS 解码器持续输出语音。用户的语音和模型的语音可以在时间上重叠——就像两个人面对面说话那样。
工具调用:不是"语音转文本再调工具",是"边说话边调工具"
这是 VoiceChat 最关键的技术区分点。之前的开源全双工模型——Moshi、PersonaPlex、Freeze-Omni——都能自然对话,但都不能在对话中调用外部工具。
VoiceChat 的做法是在 LLM backbone 的输出端加了一条独立通道,专门预测工具调用脚本。当模型判断用户需要外部信息时,它在生成语音回复的同时产出结构化的 <TOOLCALL> 指令,格式类似 OpenAI 的 function calling。更有意思的是,它还支持"hold music"机制——在等待工具返回结果的那几百毫秒里,模型会自动说一句过渡语(比如"让我查一下"),维持对话的连续性。
在 BFCL-v3 基准上,VoiceChat 的工具调用平均正确率为 56.1%。拆开看:简单工具调用 58.5%,多工具组合 62.5%,并行调用 42.5%,无关工具拒绝率 89.6%。在 Full-Duplex-Bench v3 上,工具选择准确率 82.5%,参数准确率 44.2%,综合 Pass@1 为 33%。
这些数字离专有模型还有距离,但方向已经跑通了。
对话动态:Pareto 前沿上的平衡点
Artificial Analysis 在 3 月分析 Nemotron 3 VoiceChat(早期版本)时给过一个判断:在"对话动态"和"语音推理"这两个维度上,它是唯一一个同时在两项排进前三的开源模型。
在 Full-Duplex-Bench 1.0 上,VoiceChat 综合得分 77.8%,仅次于 NVIDIA 自家的 PersonaPlex(91.0%),领先 FLM-Audio(62.0%)、Moshi(61.0%)和 Freeze-Omni(58.7%)。在 Big Bench Audio 推理上,VoiceChat 拿到 29.2%,仅次于 Freeze-Omni(33.9%),远超 PersonaPlex(12.6%)。
换句话说,其他模型要么会聊天但不会思考,要么会思考但不会聊天。VoiceChat 卡在了中间——两个都还行。
从 GTC 的早期演示到 HuggingFace 的开放权重
VoiceChat 并不是突然冒出来的。它最早在今年 3 月 GTC 2026 上以 "Nemotron 3 VoiceChat" 的名义亮相,当时是 12B 参数的早期访问版本,需要通过 NVIDIA Developer 申请才能拿到。配套的 demo 部署在 Crusoe 的 GPU 集群上,参会者可以现场跟它对话。
这次上架 HuggingFace 的 "NemotronLabs VoiceChat 11B" 是独立版本——参数从 12B 缩减到 11B,授权从早期访问协议换成了 OpenMDW 1.1,推理引擎从 NVIDIA 内部容器迁移到了 vLLM。它支持离线批量推理和交互式 WebSocket 流式部署两种模式,GitHub 上提供了完整的部署脚本。
支持硬件涵盖 NVIDIA A100、H100、H200、B100、B200 和 RTX-6000。操作系统限定 Linux。
VoiceChat 的团队背景值得注意。它出自 NVIDIA 的 NeMo Speech 团队,底层 LLM backbone 是 Nemotron Nano V2——和 NVIDIA 开源的大语言模型共享同一基座。这个血缘关系意味着 VoiceChat 在 NLP 能力上不像典型语音模型那样高度裁剪,而是继承了 Nemotron 系列在指令遵循和多轮对话上的积累。
Moshi、PersonaPlex、Freeze-Omni:VoiceChat 凭什么站在 Pareto 前沿上?
开源全双工语音模型的版图在过去两年快速扩张,VoiceChat 进场时已经不是独苗。它需要回答一个问题:为什么选它?
Kyutai Moshi(2024 年 9 月):第一个真正的开源全双工语音模型,用 Mimi 编解码器和 Helium 7B LLM backbone 实现了端到端的实时对话。Moshi 的意义是开创性的——它证明了全双工语音不一定要走级联方案。但 Moshi 的弱点也很明显:Big Bench Audio 推理得分只有 1.7%,基本不具备复杂推理能力;没有工具调用;对话自然度也明显逊于后来的模型。
NVIDIA PersonaPlex(2026 年 1 月):同为 NVIDIA 出品,PersonaPlex 在 Moshi 架构上做了大幅改进。7B 参数,支持角色和声音控制,对话自然度 MOS 3.90,高于 Gemini Live 的 3.72。Full-Duplex-Bench 得分 91.0%,是当前开源最强。但 PersonaPlex 的 Big Bench Audio 只有 12.6%,且同样不支持工具调用。它是一个顶级的聊天者,但不是一个能干活的语音代理。
Freeze-Omni:语音推理最强(Big Bench Audio 33.9%),但对话动态最弱(Full-Duplex-Bench 58.7%)。它的定位更接近"能听能说的推理模型",而不是"能自然对话的语音助手"。
FLM-Audio:62.0% 对话动态,5.3% 语音推理,整体偏弱。
VoiceChat 的差异化恰好卡在这张表的结构性空白上:它不是某个单项的第一名,但它是唯一一个在对话动态(#2)、语音推理(#2)和工具调用(#1)三项上同时有成绩的模型。对语音代理开发者来说,这意味着不用在"会聊天"和"能干活"之间做取舍。
专有模型仍然领先一大截。GPT-4o Realtime、Grok Voice Agent、Gemini 2.5 Flash 在语音推理上的得分(87%-96%)是 VoiceChat 的三倍左右。但专有模型是 API 调用,VoiceChat 是权重文件——你可以微调、量化、私有化部署,不受 API 配额和厂商定价的约束。
开源语音 AI 的 "GPT-2 时刻"
把 VoiceChat 放在更大的时间轴上,它更像是开源语音 AI 的一个拐点。
2024 年的 Moshi 相当于语音领域的 GPT-1——证明了这条路走得通,但能力有限。2026 年初的 PersonaPlex 是 GPT-2 级别——对话自然度追上了专有方案,但缺少工具调用这个关键能力。VoiceChat 补上了这块拼图。
工具调用之所以重要,不是因为"能查天气"本身有多难,而是因为它把语音模型从"聊天玩具"变成了"可编程代理"。有了工具调用,语音代理才能订机票、查数据库、控制智能家居、调用企业内部 API。这些不是锦上添花的功能,而是商业落地的前提。
当然,VoiceChat 的工具调用能力还在早期。56.1% 的平均正确率意味着每两次调用就有一次可能出错,离生产环境的要求还有距离。OpenMDW 1.1 的研究用途限制也意味着短期内看不到基于它的大规模商业部署。
但方向比绝对分数重要。NVIDIA 选择在这个时间点把 VoiceChat 以开放权重的形式放出来,释放的信号很明确:开源阵营要在语音代理这个赛道追上来了。
参考链接: