AREX Feed Article
MiniMax 官宣 H3 集成索引:24GB 本地 ComfyUI 到企业级多卡部署全收录
8 月 25 日 00:45(UTC,北京时间 08:45),MiniMax 官方 X 账号(@MiniMax_AI)发布推文,宣布推出 Awesome MiniMax H3 Integrations,一个追踪 H3 周边社区构建内容的集成索引,覆盖从 24GB 显存本地 ComfyUI 部署到企业级 SGLang 与 vLLM-Omni 服务部署的完整区间()。仓库在推文发布前 11 分钟刚完成一次推送更新,时间戳为 00:33:58 UTC()。
仓库 创建于 8 月 13 日,截至本文核对时已有 109 颗星、8 次 fork,无未关闭 issue。截至发稿,这条推文累计约 3 万次浏览、391 个赞、37 次转发和 309 次收藏,其中 31 条回复、7 条引用推文。
图注:封面取自 ComfyUI 官方博客的 MiniMax H3 Day-0 支持文章,该文被索引仓库列为官方资源之一。
挂在官方名下、由社区维护的索引
仓库挂在 MiniMax 官方 GitHub 组织(MiniMax-AI)名下,README 第一句却写明自己的身份:这是一个社区维护的 H3 检查点、工具与工作流索引,按开发者兴趣排序("A community-maintained index of checkpoints, tools, and workflows for MiniMax H3, ordered by developer interest")。贡献者列表印证了这一点:Odysseusailoon 提交 32 次,joeVenner 与 Rockdu 各 1 次。
推文把索引内容分成三类:硬件与精度地图(INT8、NVFP4、GGUF 量化指南,下限到 8GB 显存)、速度与服务(加速 LoRA、Sol-Attn、block-caching、多 GPU 生产栈)、开发者工具(原生 agent skills、timeline directors、multi-shot motion context nodes,以及面向 Apple Silicon 的 h3.c)。README 中对应的具体条目包括可安装为 agent skill 的 minimax-h3-prompt-skill-T8「Creative DNA」案例库、提供五种模板的 ComfyUI_MiniMaxH3_Director,以及把上一段视频的末帧和音频喂给下一段的 ComfyUI-H3-Motion-Context。
量化把 H3 压进 8GB 显存
表的每一行都对应一条可照做的路径。24GB 显存的首次部署组合是 pruned_int8_convrot DiT(19.53 GiB)加 NVFP4 AWQ 文本编码器(14.61 GiB)再加 ComfyUI-MiniMaxH3-Easy 节点;要速度就叠加 TE-Speed-MiniMaxH3 与 Turbo LoRA(v4_step600_ema),采样降到 6–8 步并用 block-cache 加速。12–16GB 档位用 Q4_K_M GGUF(10.64 GiB)或剪枝 NVFP4(11.67 GiB),8GB 档位走 DiffSynth-Studio 的 NF4 路径,README 提醒:这条路径靠 offloading 换显存,运行会明显变慢。
图注:H3 各组件在不同精度下的体积对比,来源同为 ComfyUI 官方博客。
量化的必要性来自 H3 的体积:官方原始 diffusers 权重共 280 个文件、464.2 GiB。8 月 3 日,ComfyUI 官方博客宣布 H3 当天以开放权重发布并获得 Day-0 原生支持。这是 MiniMax 继 Hailuo 01、Hailuo 02 之后的第三代视频模型,也是首款开放权重的()。ComfyUI 团队把约占参数总量 40% 的 AdaLN 调制权重剪枝并替换为查表,加上 int8 convrot 量化,总内存占用从全精度的 123.6 GB 降到最小变体的 42.5 GB,降幅 66%,配合动态显存 offloading 可在 RTX 3060 上本地运行。剪枝与量化的组合,正是索引中那些低显存档位能成立的前提。
加速侧的数据同样来自实测:NVIDIA Sol-Attn 的 Triton 实现(kijai/ComfyUI-SolAttn_triton)在 RTX 5090 上比 SageAttention 快 1.14–1.44 倍,MLP 峰值显存降低 37%。Apple Silicon 用户走 antirez/h3.c(MIT 协议、Metal 原生),T2V/A、首末帧与按序 Ref2VA 引用均已打通,M3 Max / M5 Max 的优化仍在进行。
企业级那半边:SGLang 与 vLLM-Omni 的配方
本地之外,索引的「Serving H3」章节记录了服务端的两条主线。SGLang Diffusion 提供原生 H3 流水线,官方 cookbook 中 sglang serve --model-variant fl2va|ref2va 的配方在真实硬件上验证过:4×H200/H100、B200/B300(在线量化)、2×RTX 5090 layerwise offload、单卡 RTX 4090 的 kitchen_int8 配置,以及经 ROCm + AITER 的 AMD MI355X/MI300X 支持。vLLM-Omni 从 v0.26.0 起提供官方 MiniMax-H3 recipe:OpenAI 兼容的 /v1/videos 服务,一个 diffusion stage 同时加载 FL2VA 与 Ref2VA 两个 DiT,共享文本编码器与 VAE,配置档从 2×RTX 4090/5090 排到 4×B300/GB200()。
这份 recipe 的验证记录写得很具体:在 2×RTX 5090 上完成过一次完整的 50 步 T2VA 请求,1344×768、124 帧、24fps,端到端 8 分 38 秒,单卡峰值显存约 22.6 GiB;每个 DiT 分区的 BF16 权重约 134 GiB,双卡部署前需备好 200 GiB 以上系统内存。索引还收录了 NVIDIA Sol-Engine 分支(Apache-2.0),在 GB200、H100、RTX 4090 等硬件上相对基线有 3.55–4.52 倍加速。
发布当天,vLLM 官方账号先来转发
公告发出 4 个多小时后,vLLM 项目官方账号(@vllm_project,4.7 万粉丝)引用推文回应:「One model, four tricks」:文字转带同步声音的视频、首/首末帧转视频、图像加音频生成对口型片段、绿幕素材加背景视频自动重打光合成,并感谢 MiniMax 在公告中点名 vLLM-Omni,附上 recipe 链接()。伦敦 AI 公司 NetMind.AI 的官方账号(4.5 万粉丝)则借势引流:「如果想试 MiniMax H3,从这里开始」,同时提示 H3 也已上架自家的 API()。
个人开发者贡献了更具体的本地实测。Dolphin 与 Samantha 系列模型作者 Eric Hartford(@QuixiAI,2 万粉丝)在回复中宣布 h3.c 的分支版本已针对 RTX 3090 优化,支持 1 到 8 卡,并加上了 UI 与 GGUF 支持,单张 3090 即可跑 bf16()。巴基斯坦开发者 Fahad Saleem 把「8GB GGUF 那一行」称作把 H3 从只能租 GPU 的名单上划掉的一行,他的工作流改为提示词与镜头测试在本地 ComfyUI 跑,只有长多镜头渲染才按小时租 GPU()。AI 视频创作者 PixelAIGC 晒出 4070 16GB 显存的部署结果:Turbo LoRA 本地跑,20 分钟出 30 秒 480P 视频,「超分后效果杠杠的」()。CoreView 联合创始人 Ivan Fioravanti(4.1 万粉丝)的概括是:本地 AI 社区在 H3 上的力量,一个超级仓库就代表了()。哥本哈根的 AI 开发者 Emad Ghorbaninia 则点出了这个跨度的意义:24GB 本地部署与企业级 vLLM 服务跑在同一套开放权重上,「这就是开源真正的卖点」()。
索引是快照,社区已经跑在它前面
README 自己给索引划了边界:「This navigation guide is not a complete compatibility list」,承认它只是一份导航指南;文末致谢名单写上了 MiniMax、ComfyUI、SGLang、vLLM、NVIDIA 和 Unsloth 等团队,并注明「这个索引之所以存在,是因为别人造出了它所指向的模型、工具、测试与文档」。上线当天,边界外的新东西已经出现:Hartford 在回复里发布的 QuixiAI/h3.c 分支,至少本文核对时还没有进入这份 README;另一位用户则用中文留言「求你了真的,快上 M3pro 吧,预告一下也行」()。