AREX Feed Article
Meta 发布 Muse Realtime Avatar:语音 token 流实时渲染化身视频,官方评测称偏好胜过 Runway 与 HeyGen
北京时间 9 月 24 日 13 时 43 分,Meta 的 AI 官方账号 ,马克·扎克伯格(账号 @finkd)已在 Meta Connect 上发布 Muse Realtime Avatar:一套把 Muse Realtime Voice 转化为有表现力、可交互化身的实时具身(embodiment)技术,首先应用于实时对话。与帖文配套的(页面标注 9 月 23 日发布)给出了官方技术口径:化身视频以 448×768 竖屏分辨率、每秒 25 帧流式生成;从用户一轮话音结束,到收到音视频同步响应的第一个字节,约需 870 毫秒。
Meta 同时公布了一组自办对比:在 Runway Characters 与 HeyGen LiveAvatar 各自的实时通话产品里正面对比,Muse Realtime Avatar 在总体偏好上胜出。测试由 Meta 组织、对手由 Meta 挑选,结果未经独立核实。
图:Meta Connect 演示中的 Muse 化身形象(图片来源:TechCrunch,原始出处 Meta/截图)
一条共享语音 token 流,同时驱动语音与化身
Muse Realtime Voice 与 Muse Realtime Avatar 构成统一的流式架构,和研究博客口径一致:Voice 承担对话智能,产出的语音 token(speech token,把语音离散成词元式的单元;博客中记作 VQ,即向量量化)同时编码「说了什么」与「怎么说」,也就是内容加上韵律(prosody)。一个音频解码器把 token 还原成声音,Avatar 则消费同一股 token 流,逐段生成画面。共享这股流,语音、口型和表情才能对上拍。
Avatar 本体是一个音频驱动的 Diffusion Transformer(扩散 Transformer),条件输入有三样:语音 token 流、参考媒体(reference media),以及一段滚动窗口内的近期视频隐变量(latent)。视频按短因果分块逐段生成,每块刚生成的最新隐变量成为下一块的 motion context(运动上下文);帖文的表述是以固定长度历史作为后续分块的运动上下文。计算量因此有界,对话进行多久,生成就能持续多久。
参考媒体决定化身长什么样、怎么动:一张人像照片靠细微表情回应对话,一张全身插画会打手势、换姿势,动物和日常物品也能变得有表现力而不失各自特点。博客强调这不限于「会说话的头」,面部、手部与全身动作都实时生成,外观与神态在对话回合之间保持连贯。
教师 120 次、学生 2 次:60 倍压缩从哪里来
实时视频生成要同时满足两件事:响应足够快;长对话中画面稳定,误差不能越滚越大。研究博客给出的解法是蒸馏。起点是一个高质量的双向(bidirectional)教师模型:40 步扩散采样,配 3-way CFG(classifier-free guidance,无分类器引导),每步需要 3 次模型前向,一个视频分块合计 120 次评估。Meta 把它压成一个无引导的 2 步因果学生模型,配固定长度的 KV cache(键值缓存)。
压缩靠两种手段合起来完成:self-forcing 让学生在训练阶段就消费自己生成的上下文,学会抵抗小误差随时间累积造成的漂移(drift),贴近推理时的真实条件;distribution matching distillation(分布匹配蒸馏)则与前者一起,把扩散过程和 CFG 的引导效果共同蒸进学生模型。结果是学生用 2 次无引导评估,复现教师用 120 次引导评估逐步精修的画面,评估次数减少 60 倍;官方偏好测试里,学生与教师接近五五开。
为并发而重写的推理栈:单卡 12 路实时会话
把模型跑进实时服务是另一道题。博客称,Meta 从零重写了实时 AI 推理栈,并配了一个专为实时视频推理设计的自研引擎:持久化 KV cache 与显存感知位置编码在分块解码时复用上下文;缓存感知路由和延迟感知动态批处理调度并发会话;4-bit 量化感知训练在压低推理成本的同时保住质量;融合算子与 NVIDIA CUDA Graph capture 减少访存和调度开销。Meta 还与 NVIDIA 合作优化了模型前向的开销。
博客给出的数字是:单块 NVIDIA GB200 芯片上,每个生成步用 20 毫秒产出 8 帧,相当于 320 毫秒的播放量,折合每帧 2.5 毫秒模型时间;相比两步 BF16(bfloat16,一种 16 位浮点精度)基线,整套优化把服务容量提升 8 倍,单卡可同时承载 12 路实时视频会话。
Meta 自办对比:78% 与 88%,外加一项统计平手
博客写明了对手:Runway 的 Characters 与 HeyGen 的 LiveAvatar。Meta 称它们是「两家领先的商用 avatar 系统」,比较用各自产品原生的实时通话体验进行。评分员与身份匹配的化身通话 2~3 分钟,再就视觉质量、同步、角色一致性与 mannerisms(神态习惯)等维度比较。
按 Meta 的口径,总体偏好上 Muse Realtime Avatar 以 78% 对 22% 领先 Runway Characters,以 88% 对 12% 领先 HeyGen LiveAvatar,且在每一个被评维度上都被更多评分员偏好。博客同时承认一处例外:与 Runway Characters 的 mannerisms 对比,在统计上与平局无法区分。
上线两周多的 Muse,先拿到一张脸
Muse 上线两周多,化身是这条产品线的最新一步。据 ,Muse 于 9 月 8 日在美国上线 iOS、Android 和 muse.ai,定位为个人 AI 代理,由 Muse Spark 模型驱动,大部分功能免费、进阶功能靠订阅。
美西时间 9 月 23 日周三,扎克伯格在 Menlo Park 拉开 Meta Connect 主题演讲,化身功能在台上做了演示。 写明:Muse 用户「很快」就能为自己的代理召唤专属数字化身并实时视频通话,由 Muse Realtime Avatar 驱动;TechCrunch 还提到,据扎克伯格所说,Muse 代理的化身名叫 Jolly。扎克伯格在演讲中说:「在我们正在构建的愿景中,Muse 是核心。我预计,未来几年 Muse 会成长为全球数十亿人用来达成目标、改善生活的个人超级智能。」
图:马克·扎克伯格在 Meta Connect 主题演讲现场(图片来源:TechCrunch)
补充了产品侧细节:此前与 Muse 沟通主要靠聊天界面,实时视频通话即将加入;化身外观现已可自定义,声音也将可调,Realtime Avatar 负责决定它怎么动。
据应用市场数据机构 Apptopia 估计( 9 月 21 日报道),Muse 上线 12 天在美国和加拿大的 iOS 下载量为 180 万次,高于 ChatGPT 同期的 130 万次;全球总安装 280 万次;美国移动端日活用户 64.2 万,超过 ChatGPT 同期的 23.1 万,美区 App Store 总榜排名从第 2 升至第 1。这些均为第三方估计,Meta 尚未公布过自家数字。
水印、18+ 与一个没有日期的「即将」
博客同时写清了边界:文中所有示例用于展示模型能力,「并非全部反映 Muse 应用内可用的化身」;Muse 仅面向 18 岁以上用户;所有生成视频都嵌入 Meta Video Seal 的持久隐形水印,博客称这不会给实时体验增加延迟,并承诺随具身 AI 的演进继续加强防护。
至于用户何时能在 Muse 里和自己的化身视频通话,TechCrunch 与 The Verge 得到的都是「即将」。截至发稿,Meta 没有给出具体日期;从 870 毫秒延迟、60 倍评估压缩到两组偏好数字,这些成绩目前全部出自 Meta 自己的口径。