AREX Feed Article
MiniMax H3 开源三天登顶 HuggingFace,Stable Diffusion 创始人公开致敬
8 月 3 日,MiniMax 在 HuggingFace 上正式开放 H3 视频生成模型的完整权重。三天之内,H3 冲上 HuggingFace 热度榜首,超过 100 家企业实现"Day 0 接入",从芯片厂商到推理框架完成全链路适配。同一天,Stable Diffusion 创始人 Emad Mostaque 在社交平台上写下"Bravo to MiniMax",公开向这家中国 AI 公司致敬。引用数据称,中国研发的开源模型下载量已占全球总量的 41%,位列世界第一;在全球主流大模型调用榜单上,排名前六的模型全部来自中国团队。
据 报道,今年 3 月 OpenAI 关停了上线不久的 Sora,终结了与迪士尼的巨额合作,日均推理成本高达百万美元。同一篇报道引用 Artificial Analysis 数据指出,H3 的 2K 音视频生成价格约为每分钟 7.8 美元,而多款主流闭源视频模型仅提供 1080p 输出,每分钟定价却在 20 美元以上:更高的画质,不到对手四成的价格,再加上全面开源。
"Bravo to MiniMax":一句致敬背后的信号
8 月 3 日,Stable Diffusion 创始人 Emad Mostaque 在社交平台上写下了"Bravo to MiniMax(向 MiniMax 致敬)"。 还原了这条信息的上下文:Mostaque 是在看到 MiniMax 正式开放 H3 核心权重后发出的。四年前,正是他创办的 Stability AI 通过 Stable Diffusion 第一次把高质量图像生成从少数公司的服务器中释放出来,交到全球开发者手中。如今,一个中国团队在视频领域做了同样的事。
几乎同一时间,硅谷顶级投资机构 a16z 合伙人 Justine Moore 在震惊中晒出了自己的实测结果。过去一年半,她一直用一道看似简单的题目测试不同 AI 视频模型:让画面中的男子用粉笔在黑板上写下"Hi"。此前,从没有一个模型能通过这项测试。H3 是第一个。对视频模型而言,这道题要求它在连续时间里同时处理手、粉笔与黑板的接触关系,理解笔画出现的先后顺序,还要保证已经写出的字母不会随画面变化而扭曲消失。
一位是生成式 AI 开放运动的标志人物,一位是长期关注产业竞争的硅谷投资人。他们同时将目光投向了一家中国公司——不是因为市面上又多了一个头部视频模型,而是因为世界第一梯队的视频生成能力,不再锁在闭源产品和高价接口背后。
三天,三个第一
,MiniMax 官方宣布 H3 在全球众包评测平台 Design Arena 的多图生视频、图生视频、视频编辑三个类别同时登顶。"Three categories. Three #1s. Frontier performance, without the frontier price tag. And the weights are open."在 Artificial Analysis 的评测中,H3 的视频编辑位居第一、文生视频排名第二、图生视频排名第三,是同时进入三个类别前三的唯一模型。
与此同时,H3 在 HuggingFace 上迅速攀升至热度榜首,与 DeepSeek 最新模型共同占据前列。社区的反应速度惊人:发布当天,华为昇腾、AMD、Intel 等芯片厂商迅速完成适配,HuggingFace、魔搭 ModelScope、ComfyUI 等平台同步接入,多个主流推理框架提供支持。 在开源公告中详细列出了两个任务变体:FL2VA(文本/首尾帧生成视频)和 Ref2VA(多模态参考生成视频),以及完整的模型架构文档。
ComfyUI 对 H3 的优化是社区工程效率的一个缩影。通过一系列工程优化,其方案把模型总体内存占用从 123.6GB 降至 42.5GB,使消费级显卡也有机会本地运行前沿视频模型。Redis 作者 antirez 甚至在 GitHub 上发布了 ,一个用纯 C 和 Metal 编写的 H3 推理实现,不依赖 Python 和 PyTorch,在 Apple Silicon 上直接运行。
33B 参数的"全模态"系统
详细披露了 H3 的系统设计。H3 是一个通用全模态生成系统,能够统一理解由文本、图像、视频和音频构成的多模态上下文,并生成带有原生立体声的视频。分辨率最高 2K,时长 4 到 15 秒,帧率 24fps,音频规格为 32kHz 立体声。
完整的 H3 系统由三个模块组成。H3-Context-IR 负责解析自由形式的多模态输入,将其转换为结构化中间表示;H3-Base 基于该表示生成 768p 分辨率视频和音频;H3-Regenerate-2K 则将 768p 结果连同原始上下文重新输入模型,以 in-context 方式再生成为 2K 输出。这不是传统的超分辨率放大,而是利用原始多模态上下文恢复画面中的小文字和精细细节。
H3-Base 的核心是一个 33B 参数的密集单流 Transformer(H3-Omni-Transformer),其中约 13B 参数位于 AdaLN 相关分支。这些参数在推理部署时可预计算并缓存,无需加载。文本编码器使用了 Qwen3-VL-32B 的完整预训练权重。视觉编码采用时序因果 VAE(空间压缩 16×,时序压缩 4×),音频编码则由独立的 AudioVAE 处理,左右声道独立编码后重组为立体声输出。
H3 在训练最终阶段引入了原生稀疏注意力以降低长序列的计算成本,但首批开源发布仅提供全注意力推理,稀疏注意力实现将在后续更新中发布。同样,H3-Context-IR 和 H3-Regenerate-2K 两个模块因系统复杂度暂未开源,目前通过 API 提供。跑通官方 2K 全流程仍需要两次 API 调用。
许可证方面,指出 H3 的社区许可证排除了美国、欧盟、英国和韩国,这些地区的开发者无法合法地进行本地部署。MiniMax 开发者关系负责人 Ryan Lee 公开解释,美国市场的限制与公司正在进行的与好莱坞制片厂的版权诉讼直接相关:迪士尼、环球和华纳兄弟于 2025 年 9 月联合起诉 MiniMax,指控其 Hailuo AI 平台使用未经授权的版权角色进行训练。
从 DeepSeek 到 MiniMax:一条正在固化的中国路径
如果说 DeepSeek 在文本领域打破了"开源就是次优选择"的成见,H3 则在视频领域画出了同一条线。
援引数据称,中国研发的开源模型下载量已占全球总量的 41%,跃居世界第一;在全球主流大模型调用榜单上,排名前六的模型全部来自中国团队。美国投资机构统计显示,多达八成的美国 AI 初创公司在融资路演中会使用中国的开源模型。MiniMax 服务的全球企业与开发者客户已超过 100 万,较半年前增长五倍。
这条路径并非凭空出现。此前,DeepSeek 最新一代模型发布并开源,参数量近三万亿的 Kimi K3 为全球开源社区贡献前沿智能,千问系列旗舰模型 Qwen3.8 上线并即将开源。中国大模型企业正在以"开源"为共同路径,加速技术迭代与生态构建。
英伟达创始人黄仁勋多次公开表示,开源模型有助于提升安全性与网络安全,加速创新与传播。"中国注定产出卓越的人工智能技术,应继续向中国学习,并与中国合作。"他在一次公开发言中说。
资本市场的反应同样值得关注。H3 发布后,MiniMax 股价连续走强,8 月 6 日正式纳入港股通,华尔街投行杰富瑞重申买入评级,花旗同样维持买入。一家中国 AI 公司选择把最先进的视频模型开源,市场将其解读为生态扩张的信号,而非商业价值的让渡。
开源,可能从一开始就是视频 AI 的最优解
Sora 的退场并非技术失败,但它揭示了一个深层困境:视频生成是 AI 中推理成本最高、工程链条最复杂的领域之一。当模型足够强大后,由一家公司独自承担天量推理成本的路,可能从一开始就不是最合理的。
H3 出现后,这个判断变得更加清晰。最前沿的视频生成能力,不再唯一属于那些能烧得起百万美元日算力成本的公司。开发者可以在本地部署和优化,芯片厂商可以围绕模型特性做适配,推理框架可以第一时间集成——开源释放出的协同效应,正在把视频 AI 从一个少数玩家的烧钱竞赛,变成一套可以持续进化的产业基础设施。
H3 的系统设计中有一个容易被忽略的细节:H3-Regenerate-2K 模块用 in-context 再生替代了传统超分辨率。这不是一个工程上的小修小补,而是一种设计哲学——让模型的能力复用自身,而不是在外部挂载一个独立组件。这种思路与开源策略有着内在的一致性:不依赖外部壁垒来维持竞争力,而是让能力在开放中自我强化。
当"向中国开源致敬"从 Emad Mostaque 的一句推文逐渐成为一场产业共识,H3 的登顶就不是一个孤立的热榜事件,而是一段更长轨迹上被清晰标出的一个坐标。