AREX Feed Article
MiniMax H3 联手 ComfyUI 直播:33B 模型跑上消费级 GPU,原生音频一个 pass 出片
8 月 10 日,MiniMax 结束了与 ComfyUI 的 ,随即发推总结。在这场直播中,MiniMax 演示了 H3 开源视频模型的 reference-to-video、原生立体声音频、多镜头商业广告创作,以及量化、offloading、Context-IR 和消费级 GPU 部署方案。
写道:"From reference-to-video and native audio, to multi-shot commercial creation, MiniMax H3 showcased the expanding possibilities of open-weight video models. The stream also took a deep dive into quantization, offloading, Context-IR, and practical deployment on consumer-grade GPUs."
"H3 is just getting started," 推文以这句话收尾。
社区 48 小时内搞出了量化版、Turbo LoRA 和 MLX 支持
ComfyUI 创意技术专家 Comfy Rob 在直播开场说:"This model has been definitely a game-changer. It's a step up in the Openweights video model space — this is a model that everyone in the community has been waiting for."
Rob 在直播中展示了 text-to-video、image-to-video 和 reference-to-video 三套官方工作流模板。他用 reference-to-video 模式跑了一段产品广告 demo,称模型在 sleek cinematic product advertisements 这类商业场景中表现尤其出色。
MiniMax DevRel 负责人 Victor 在直播中感谢了社区贡献者 Kijai:"He was the one working on the quants on the Comfy side and did such a good job — he actually did release a four to eight-step LoRA recently." 这个 把 H3 约 20 步的采样压缩到 4–8 步,6–8 步下画质接近原版,生成时间从 8 分钟降到 2–3 分钟。
MiniMax H3 系统工程师 Pike 对社区速度表达了惊讶:"The speed that we're able to deliver different quantizations like ComfyUI's quantized versions, different support for different hardware like MLX — all in less than 48 hours since we launched the open weights."
到 8 月 9 日,Hugging Face 上 H3 的衍生模型和 fork 已超过 300 个。社区出货了 GGUF Q2–Q5、INT4/INT8、NVFP4 等多条量化线,还做出了 Prompt Rewriter LoRA、Motion LoRA 和 LightX2V Turbo LoRA。Ken Iidabashi 在 中写道:"the community has shipped quantized variants, speed LoRAs, training toolkits, prompt engineering adapters, and alternative inference frameworks."
从 teaser 到 open weights,只用了四天
H3 的时间线压缩得极紧。
7 月 30 日,MiniMax 官方账号发出一句两词 teaser:"It's coming." ,MiniMax 工程师 RyanLee 在个人账号上放出声明:H3 在 Artificial Analysis 视频排行榜上拿到 Video Editing (With Audio) 第 1 名,Text-to-Video 和 Image-to-Video 分列第 2。
7 月 31 日,H3 通过 API 上线,。
8 月 3 日,,同日 ComfyUI 的 PR #15224 合并,四个原生节点和六套官方工作流模板落地。Comfy-Org 同步发布了 ,含 BF16、INT8、pruned INT8 和 NVFP4 四套方案。
8 月 7 日,将在 8 月 10 日与 MiniMax 联合直播,预告内容涵盖 live demo、consumer hardware 部署、Context-IR API 和 2K 再生流程。推文获得 263 个赞和 5.4 万次观看。
一个 Transformer,同时出画面和立体声
H3 与其他开源视频模型最核心的差异在于:它不是先出无声视频再贴音频,而是在同一个 Transformer 的前向传播中联合生成画面和 32kHz 立体声音频。
据 ,系统由三层构成。H3-Context-IR 是托管预处理层,把多模态输入转化为结构化中间表示。H3-Base 是 33.1B 参数密集单流 omni-transformer,输出 768p 视频和原生立体声音频。H3-Regenerate-2K 从 768p 结果出发,在原上下文内重新生成 2K 画面——不是外挂超分,而是让模型在已有参考资料基础上补回细部纹理和小字。
开放权重只覆盖 H3-Base,以两个 checkpoint 发布:FL2VA 处理 text-to-video 和首帧/尾帧条件生成;Ref2VA 接受最多 9 张参考图、3 段参考视频和 3 段参考音频作为条件输入,混合输入上限 12 个文件。Context-IR 和 Regenerate-2K 目前仍通过 MiniMax API 提供。
部署端,社区已建立清晰的硬件梯度。BF16 完整权重约 123.6GB,需要 80GB+ VRAM。官方推荐的 INT8 方案中,pruned INT8 diffusion model 仅 19.5GB,加上 INT8 text encoder 25.3GB,总计约 44.8GB,在 24GB 显存的 RTX 4090 上可通过 CPU offload 运行。最激进的 NF4 量化把门槛压到了 8GB VRAM。
直播中,MiniMax 团队重点讲解了 Context-IR API。工程师 Pike 解释,Context-IR 可以将用户输入优化为 H3 更容易理解的 prompt 格式,尤其在涉及多模态参考素材时,"it optimizes the prompt that you put into H3 specifically for all these different references."
33B 参数,开放权重,但美国用户被排除在外
H3 的开源附带条件。其 排除了美国、欧盟、英国和韩国用户的本地部署权利——这些地区的开发者只能通过 API 调用,无法在自有硬件上运行开放权重。
但这并未阻止生态生长。在开源视频模型领域,H3 是目前唯一一个在 Video Editing (With Audio) 排名第一、且提供可下载权重的模型。Comfy Rob 在直播中评价:"It's a step up in the Openweights video model space — this is a model that everyone in the community has been waiting for to reach a level of quality that we previously didn't have with Openweights models."
Victor 补充说,H3 在视频编辑场景中的表现 "up to if not exceeding some of the other state-of-the-art models that are currently out there that are closed source."
MiniMax 推文下,中文用户 :"消费级显卡能跑起来,才是最让人期待的部分。" 另一位用户 写道:"Open weight video models running on consumer GPUs is a big deal."
H3 才刚刚起步
MiniMax 在直播后推文里写的 "H3 is just getting started",放在发布一周后的节点上说,比发布当天更有分量。
一周时间,一个 33B 参数的视频模型从 Hugging Face 上的原始权重,变成了可以跑在 24GB 消费级显卡上、带 4 步 Turbo LoRA、支持 MLX 和 GGUF 的社区工程。MiniMax 没有独自做到这一切,但选择开放权重让它成为可能。