AREX Feed Article
Viggle 发布首个开放权重模型 Viggle-Animate,一帧重绘即可替换视频角色
北京时间 9 月 5 日 01:19(UTC 时间 9 月 4 日 17:19),发文宣布发布 Viggle-Animate,称其为公司“第一个开放权重模型”。权重已上架 (仓库 Viggle/Viggle-Animate),同日上线,博客与模型卡中均提供了在线试用入口 viggle.ai/h3。
按官方口径,Viggle-Animate 是 MiniMax-H3 的 ref2va 变换器(33.1 B 参数)全参数微调:输入一段“驱动视频”和该视频某一帧的重绘版本,输出角色被替换后的整段视频。渲染阶段不需要姿态骨架、蒙版或文本提示词,官方给出的效率数字是 3 次前向传播、单张 B200 上 26 秒生成约 5 秒视频。以上能力与性能均为厂商自述口径,未经第三方独立验证。
图:Viggle 官方博客的演示拼图,图中文字写明“8 个角色,1 段驱动视频”
为什么一帧重绘就够
角色替换视频的常规做法是先建中间表示:姿态骨架、分割蒙版、背景板、人脸裁剪,各自需要一个提取模型,每个提取器都是一次额外的模型运行和信息损耗点。模型卡写道,近年一些工作丢掉了骨架但保留一个 mask 通道,Viggle-Animate 两者都不用。理由是参考帧直接取自这段视频本身,姿态、机位、取景与光线和素材天然一致,下游不需要再做任何对齐。
把角色“画”进这一帧的工作外包给了外部图像编辑器,官方在博客里点名 gpt-image 这类工具。Viggle-Animate 的任务只剩一件事:把这个改动传播到整个镜头。模型始终不知道新角色是什么,没有类别标签、没有身份编码器、不读用户提示词;渲染时文本编码器根本不加载,只用随权重附带的一段固定文本嵌入(assets/fixed_prompt.txt),每次渲染完全相同。
管线里没有“脖子加两条手臂”的人形假设,也没有“人形空洞”式的蒙版,能动画的对象因此不限于人。官方示例包括动物、黏土风格角色和一只客机:机翼绑到手臂、起落架绑到腿,被官方称作最难处理的案例之一。多角色场景则把绑定工作挪进重绘提示词,靠“左边那个”这类位置描述区分。
双教师蒸馏:30 步压成 3 步
速度来自两处叠加:渲染时没有姿态估计、分割、人脸追踪、文本编码这些辅助模型可跑;采样器又被蒸馏过,成片只需 3 次前向传播而不是 30 次。官方披露的做法是双教师蒸馏:噪声调度的高噪端由自家微调模型监督,确保替换正确;低噪端由原始 MiniMax-H3 监督,保住细节与质感,两端的优势收进同一个学生模型。默认配置 --steps 4,即 4 个 sigma 边界之间走 3 次传递。
仓库里只发布两部分:33.1 B、bf16(bfloat16)精度、14 个分片的微调 transformer,和一张 rank 128、覆盖 302 个线性层、2.5 GB 的蒸馏 LoRA(低秩适配权重)。模型卡提醒,这张 LoRA 是叠在微调版之上的增量,直接加载到未微调的原版 transformer_ref 上会得到“垃圾输出”。VAE(变分自编码器)、音频 VAE 与调度器要从你自己下载的 MiniMax-H3 副本里取:H3 仓库约 269 GB,单次推理只用到其中约 11 GB。
官方给出的对照对象是 Wan2.2-Animate-14B。在同一台机器、同一张 B200、同源视频、同分辨率同帧数下,Viggle-Animate 整段渲染 26 秒对 160 秒,其中采样 13.6 秒对 140 秒,前向传播 3 次对 40 次,参数 33.1 B 对 17.3 B,折算单条片段快 6.1 倍、纯采样快 10.3 倍。Viggle 注明,Wan 的 160 秒不含它自己的预处理环节;这是一组由 Viggle 自行完成的对照。
跑起来的硬件门槛不低:bf16 下模型常驻 62 GiB,480×832、124 帧单次渲染峰值分配 80.1 GiB,官方明确“一张 80 GB 的卡不够”,建议至少 96 GB 显存,或用 --offload 把权重流式搬进 CPU(约 12 GB 常驻,明显更慢)。官方称公司内部在单张 32 GB 的 RTX 5090 上以 NVFP4 量化跑通过,但这条消费级路径没有随仓库发布。
图:官方管线示意,图中划掉了姿态骨架、分割蒙版、人脸裁剪与文本提示词
H3 开源一个月后,Viggle 第一次交出权重
底座 MiniMax-H3 是 MiniMax 在 2026 年 8 月 3 日的通用多模态视频生成系统,文本、图像、视频、音频统一输入,最长生成 15 秒、24 fps、带立体声音频的视频。开放的是两个 H3-Base checkpoint:FL2VA 与 Ref2VA。其中 Ref2VA 是参考模式,最多接受 9 张图、3 段视频或 3 段音频作为参考,混合输入上限 12 个文件;负责理解复杂上下文的 H3-Context-IR 与 2K 再生模块没有随权重开放,MiniMax 以 API 和教程补齐。
Viggle-Animate 微调的是 Ref2VA checkpoint 里的 transformer,并把输入收敛成“驱动视频 + 一帧重绘”,文本提示不在其中。距 H3 权重开放约一个月,Viggle 就把基于它的微调权重发布了出来。
据 ,该公司当时完成由 Andreessen Horowitz 领投的 1,900 万美元 A 轮融资,Two Small Fish 参投;公司注册名 WarpEngine Canada Inc.,2022 年由 CEO Hang Chu 创立,他此前是 Autodesk 机器学习实验室的首席研究科学家,更早供职于 NVIDIA。当时的产品形态是上传一张图和一句提示词(或用一段视频指定动作),由自研模型 JST-1 生成短片,报道称累计用户超过 400 万,付费 Pro 层每月 9.99 美元。两年后,官方把 Viggle-Animate 定义为“第一个开放模型发布,也是接下来若干发布中的第一个”。
一次微调实现的“工作流创新”
发布约一个半小时后(UTC 时间 9 月 4 日 18:48),本地 AI 应用工具 Pinokio 的开发者 (其 X 简介自称让用户在自己电脑上免费运行 AI 应用)发了一条:“如果我没理解错,这里的想法非常聪明,甚至可能是对未来的惊鸿一瞥。我们习以为常的整套工作流都会被拆解:把姿态检测、分割这些重活整个拆掉,外包给外部图像编辑器(比如 gpt-image-2)只处理一帧,那一帧就够用了。丢掉 pose/mask/face 管线之后,模型本身就可以很快。一个工作流创新,用一次微调实现。”
这条引用推文截至核对时显示 40 次点赞、4 次转发。发布约 11 小时后(UTC 时间 9 月 5 日 04:25 核对),宣布发布的主推文累计约 7,700 次浏览、57 次点赞、12 次转发、81 次收藏、3 条引用。Reddit 的 r/StableDiffusion 板块也出现了题为“Viggle-Animate: Character Replacement based on MiniMax-H3 with 3 forward steps”的。
衍生权重的许可,与官方承认的短板
这套权重是 MiniMax H3 的衍生作品,适用 MiniMax H3 Community License。模型卡写明,在再分发或基于它提供产品之前要先读许可,Viggle 的改动列在 MODIFICATIONS.md;仓库里的推理与示例代码则是 Apache 2.0。许可前提同样写进了官方博客。
模型卡还给了一段使用边界说明:替换进画面的身份来自用户重绘的那一帧,因此图像编辑器里的安全措施处在模型上游,模型自身无法验证身份或同意,“它会同样轻易地把某人放进他从未同意出现的画面”。官方要求只对同意出镜的人运行,并把生成内容标注为 AI 生成。
官方承认的短板有三块。口型同步弱,近距离特写里嘴型跟不上语音,官方猜测这主要是训练数据所限,而非模型结构问题。复杂场景质量明显下降,多角色、角色近距离互动、镜头切换都不在“已解决”之列。此外,重绘帧里没画出来的细节模型不会自行补上,画面与视频冲突时形状由驱动姿态说了算,模型卡举的例子是:LEGO 小人保住了配色和黄色爪子手,却退回成了人体解剖结构。
对下一步,模型卡写的是:官方正在训练一个明显更好的模型,目标正对着上述短板,“这次发布是我们今天能交付的版本,而不是天花板”。