AREX Feed Article
Meta 发布首个实时音频感知模型 Muse Voice Transcribe,流式转写登顶
Meta Superintelligence Labs(MSL)当地时间 9 月 1 日(北京时间 9 月 2 日凌晨)推出其首个实时音频感知模型 Muse Voice Transcribe:实时流式语音转写(streaming ASR)、20+ 说话人分离(speaker diarization)与端点检测(endpointing)在同一个模型里原生完成,即日起经 Meta Model API、Meta AI for Mac 与 Muse Code 上线,并已驱动 Meta 桌面应用与 Muse Code 的听写功能。
独立基准平台 Artificial Analysis 在发布当天给出的数字,让「第一」有了第三方验证:最终转写词错率 3.1%、语毕 0.16 秒出稿,位列其流式转写榜单(AA-WER Streaming)第一;定价 0.18 美元/小时,即每 1,000 分钟 3 美元。
扎克伯格比官方账号早约 10 分钟官宣
UTC 时间 9 月 1 日 17:15(北京时间 9 月 2 日凌晨 1:15),Meta CEO 马克·扎克伯格在 X 上率先发帖:Muse Voice Transcribe 是 MSL 的首个实时音频感知模型,当天开始上线,流式语音转写达到当前最优(SOTA),说话人分离与端点检测原生集成在单一模型里。
约 10 分钟后,Meta 官方账号 @AIatMeta 发布完整官宣。17:31,X 账号简介为「Meta 首席 AI 官、MSL 创始人」的 Alexandr Wang 连发四条推文,称这是「我们的首个实时音频感知模型,流式语音转写的 SOTA」,并且「已驱动 Meta 桌面应用与 Muse Code 的听写功能」。
据两人 X 账号简介,MSL 负责 agent 产品的 Spencer Barnett 补充,Meta AI macOS 应用即刻可用,并在回复中给出技术博客链接;MSL 工程师 Claire Zhou 说明 Muse Code 的语音模式(Voice mode)由该模型驱动。
同日上线的技术博客《Introducing Muse Voice Transcribe》写明基准口径:「我们在 Artificial Analysis 的流式语音转写与公开说话人分离基准上排名第一,模型收录与排名截至 2026 年 9 月 1 日。」
80 毫秒一个 token,延迟由模型自己决定
Muse Voice Transcribe 是 Muse Spark 家族的自回归多模态大语言模型。Muse Spark 是 MSL 今年 4 月 8 日发布的第一个大模型系列。
音频按 80 毫秒(12.5 Hz)切块,每块转为单个 soft token。每处理一块,模型在「继续听下一块」与「输出文字」之间做决定:继续听时预测 <|next_audio|> 特殊 token,下一步输入时再替换为真实音频块;音频流结束则插入 <|empty_audio|>,模型随后输出全部剩余文字。
「听多久再开口」被直接写进训练目标。官方称,模型把词错率(WER)奖励与延迟奖励相乘,用强化学习(RL)训练出自适应延迟:难词多等一会儿、易词早出,逐词在准确率与延迟之间取舍。官方称,按「语毕到最终转写的时间」衡量,该模型处于速度-准确率权衡的帕累托前沿(Pareto front)。
转写之外,同一模型还分说话人、判端点
说话人分离与端点检测通过额外特殊 token 实现:<|start_of_turn|> 标记潜在说话人切换,<|speaker_A|>~<|speaker_Z|> 区分说话人;<|speech_onset|> 与 <|speech_endpoint|> 标记语音开始与结束。博客给出的示例 token 序列为:<|start_of_turn|>Hello, how are you doing?<|speaker_A|> <|start_of_turn|>Hey I'm good!<|speaker_B|>。三项任务与流式转写联合训练,各自叠加额外奖励。
语言方面,模型以 70+ 种语言训练,其中 25 种经过充分验证,官方建议首发阶段优先使用这 25 种;支持句中或句间任意语码切换(code-switching),并可用语言、关键词与上下文偏置(language/keyword/context biasing)提升准确率。单次会话可超过一小时、容纳 20+ 说话人,且无需后处理。
博客称,Meta AI 与 Muse Code 的语音听写已一键切换至该模型,按住 Fn 键可在任何窗口使用。
Artificial Analysis 的独立测量
测量在 UTC 时间 18:06 由 Artificial Analysis 给出:最终转写词错率 3.1%、语毕 0.16 秒出稿,居其流式转写榜单(AA-WER Streaming)第一;首段部分转写(first partial)词错率 3.6%、语毕 0.13 秒。对比项包括:Cartesia Ink-2(语义端点)3.4%、0.43 秒,ElevenLabs Scribe v2 Realtime 3.6%、0.14 秒,Muse 在准确率上领先、延迟互有胜负。 该榜单页面已收录 Meta。
价格同样由 Artificial Analysis 给出:0.18 美元/小时,即 3 美元/1,000 分钟,低于 Cartesia Ink-2 的 4 美元,不到 ElevenLabs Scribe v2 Realtime 与 Deepgram Flux 的 6.5 美元的一半。
「公开说话人分离基准第一」目前是 Meta 官方口径,官方材料未附第三方复核数据。官方推文下有用户追问「3.1% 词错率是独立测量还是自报?」(Is the 3.1% WER independent or self-reported?),Artificial Analysis 随后发布的正是同一数字。 发布当天,科技媒体 The New Stack 以《Meta just beat OpenAI and Google at real-time transcription》为题报道了这次发布。
评论区里的两个追问:开源与技术报告
AI 新闻通讯作者 Rohan Paul(X 粉丝 15.5 万)写道:「它学的不只是转写——什么时候该等、什么时候落字、说话人何时切换、一轮发言何时结束,全在同一个流式模型里完成。这比传统的语音转写 API 更接近语音智能体的实时感知层。」
自称 Mistral AI 大使、专做模型评测的 Noctus 认为「对语音智能体来说这可能是个大事,尤其是延迟和『谁在说话』很重要的场景」;ForgePilot 创始人 KYD 判断「实时转写做到这个程度,会让语音成为更多软件的默认交互界面」;中文用户 ajs6888 说:「20 多人分轨加实时转写,会议录音终于不用手动拆了。」
另一面是开源质疑。官宣发出约 30 秒后,就有人回复「不开源吗?(No open sauce?)」;有用户追问「说好的开源承诺呢?这会是一份有价值的贡献,也有助于 Meta 的声誉」;「本来想要一份技术报告」(Would've loved a technical report)的评论同样存在。
Kevin Gati 的评论把问题落在访问权上:「实时转写是一种能力,房间里 20 个人也是能力。产品的问题是,谁能查询这条流,谁不能。」
这些追问的背景是 Meta 四月的表态:Muse Spark 发布时,官方称「希望开源未来版本的模型」。 而 Muse Voice Transcribe 以 API 形式交付,官方博客与官宣推文均未提及开源或技术报告。