AREX Feed Article
Redis 之父为 MiniMax H3 写出 Mac 推理引擎,官方:「你雇不来」
8 月 10 日,Redis 创始人 antirez 在 Twitter 上丢出一个 GitHub 链接——,一个用纯 C 和 Metal 手写的 MiniMax H3 推理引擎,专为 Apple Silicon Mac 而生。此时距离 MiniMax 在 Hugging Face 上开放 H3 模型权重,刚过去一周。
MiniMax 官方账号在约 12 小时后发推致谢,措辞里带着藏不住的兴奋:「地球上最顶尖的程序员之一,刚为 MiniMax H3 写了一个 Mac 推理引擎。开源权重意味着任何人都能把 H3 带到任何硬件上,而这次『任何人』恰好是 Redis 的创造者。你雇不来这种事,你只能开源,然后等着它发生。」截至发稿已获得超过 500 次点赞、27 次转发和 2.6 万次浏览。
一个 MiniMax 工程师的 Redis 启蒙
antirez 的项目发布后,最先在社区里传开的是一条个人推文。
Asuka Zheng(@VoidAsuka),MiniMax 的 AI 研究员,在 antirez 发推后紧接着写道:「我当年作为物理系学生、没有任何实习经历,就是靠读 antirez 的 Redis 源码拿到了第一份工程工作。现在,这个我读过源码的人,正在为我们公司开源的模型写推理引擎。」这条推文在 24 小时内获得了 74 次点赞和 36 次书签。
antirez 本人在项目 README 和推文中的措辞则很简洁。他在中写道:「Enjoy, modify, and so forth」,并特别指出代码中包含 @liuliu(Draw Things app 作者 Liu Liu)的贡献,欢迎他「取回任何对 Draw Things 有用的部分」。Liu Liu 很快在评论区回应,给出了 int8 量化的技术建议,antirez 回复称目前只支持 MiniMax 发布的完整 BF16 权重。
社区反应同样迅速。日本用户 @aigeboku 用日语写道:「これだよこれ。これがオープンウェイトの魅力(就是这个,这就是开放权重的魅力)。」获得了 40 次点赞和 43 次书签。中文社区用户 @geminixiang 则将 h3.c 比作 DeepSeek V4 的 ds4.c 时刻:「MiniMax H3 要迎接 ds4.c 時刻了。」
在 antirez 的评论区,有人请求 M1 16GB 支持,有人在 M3 Ultra 上下载权重准备测试,还有用户 @Beamsters1 指出可以利用 M5 的 W8A8 路径将去噪速度再提升约 1.5 倍。
33GB 权重,40GB 内存,M5 Max 上 3.5 秒出一段视频
h3.c 是一个可工作的 Metal 推理引擎,支持文本到视频、文本到音频、图像条件生成和视频续写,输出上限 768×1344 像素、24fps。
项目的 README 给出了清晰的性能基线。在 M5 Max 上,快速预设(20 步去噪、45 层 transformer、reuse 2)生成 512×512 的 22 帧视频约需 16.69 秒。如果降到 4 步去噪,仅需约 3.5 秒——虽然画质有损,但全视频 SSIM 仍达到 0.556(对比 29 步参考,0.556 是对一条狐狸走雪地视频的实测值)。启用 token reduction 后,45 层 + reuse 2 的去噪时间可从 16.69 秒进一步压缩到 12.60 秒。
内存方面,Hugging Face 上的 transformer checkpoint 约 33GB,端到端生成的峰值物理内存约 40GB。确认了这些数字,并指出 h3.c「在 M5 上使用 Metal 4 的 TensorOps 进行 BF16 矩阵运算,提供了一条 int8 量化路径(19.32 秒对比 BF16 的 25.80 秒),并通过激活缓冲区别名(activation buffer aliasing)在 512 级别几何上释放了 61.25 MB」。
h3.c 的依赖极简:C 编译器、Make、Metal 框架和 FFmpeg。没有 Python,没有 PyTorch,没有 CUDA。antirez 在推文中称自己「appreciate more open weight releases that hit all the public at the same time」,而 h3.c 的 MIT 许可证比 MiniMax 自己的社区许可证更加宽松。
不过门槛同样明确:目前仅在 M3 Max 和 M5 Max 上测试通过,M1 和 16GB 内存设备无法运行。
开源十天,等来一个 Redis 之父
MiniMax H3 的商业版本于 7 月 31 日在 Hailuo AI 平台上线,8 月初将权重发布到 Hugging Face,同时推出了 ComfyUI 的原生支持节点。将 H3 描述为「通用多模态生成模型」,能同时理解文本、图像、视频和音频,生成带原生立体声的 2K 视频,单次提示可包含最多 9 张参考图、3 段视频和 3 段音频。
H3 发布后迅速在评测榜单上取得突破。Artificial Analysis 将其排在 Video Editing 类别全球第一、Text-to-Video 第二、Image-to-Video 第三——这是开源视频模型首次登上该榜单的榜首。指出,该模型有 33B 参数,权重在 MiniMax 社区许可证下发布,允许年收入低于 2000 万美元的组织免费商用。
antirez 对 H3 的兴趣在 8 月 8 日首次公开。他发了一条带视频的推文:「Only 10 steps in this example to make the video short, yet H3 is quite fun.」两天后,h3.c 的 GitHub 仓库于 8 月 9 日创建,8 月 10 日正式对外公布——从拿到权重到交出一个完整的 Metal 推理引擎,大约一周。同一周,antirez 的另一个项目 DwarfStar 也通过 DFlash speculative decoding 将 DeepSeek V4 Flash 的解码速度提升了 27%。
MiniMax 官方在 8 月 4 日就曾发推致谢本地社区,称「发布一天内就看到 H3 在 Mac 上跑起来了」。但 antirez 做的事和社区早期适配不同——社区在已有框架上适配 H3,他从零写了一个推理引擎。
Mac 本地视频生成,不再只是 CUDA 的故事
此前,视频生成模型的本地推理几乎被 CUDA 生态锁定。MiniMax H3 的官方 ComfyUI 节点虽然支持本地运行,但依赖 PyTorch 和 CUDA,最高输出 768p,达不到云端 2K。Mac 用户要么用云端 API,要么放弃视频生成。
h3.c 改变了这个等式。它在 Apple Silicon 上直接通过 Metal 调用 GPU,不经过 Python 层,不依赖 PyTorch。antirez 的做法与他在 Redis 时代一脉相承——用最少的依赖、最高的效率,把硬件的潜力榨到极致。
h3.c 目前仅限 M3/M5 Max、至少需要 64GB 统一内存,能直接服务的用户并不多。但它证明了一件事:一个世界级的系统程序员,独自在一周内将一个前沿视频模型带到了一块非 CUDA 芯片上。这种可能性只在模型权重真正开放时才存在。
与此对照的是,同一天发布的字节跳动 Seedance 2.5 选择了闭源路线,生成 30 秒带音频的视频,但所有推理必须走云端 API。 指出,H3 是首个登顶视频评测榜单的开源模型。而 antirez 的 h3.c 证明,开放权重不仅能带来榜单排名——它还能带来你雇不到的人。
antirez 的西西里模式:不开公司、不拿 offer、只写代码
antirez 住在意大利西西里岛。他没有加入任何 AI 公司,也不是 MiniMax 的员工或顾问。他的 Twitter bio 写着:「I like programming too much for not liking automatic programming.」这句话也是他所有项目的注脚。
MiniMax 官方推文中那句「you can't hire this」之所以成立,正是因为 antirez 不受雇于任何人。MiniMax 没有派开发者关系团队争取他,没有给他合同或报酬。H3 开源后,他自己决定动手。MiniMax 能做的唯一一件事,就是把权重放出来,然后等着。
这种贡献无法预算、招标或者用 offer letter 买到。它只在一种条件下发生:模型权重真的开放,文档真的够用,门槛真的够低。h3.c 是这些条件被满足之后,自然产生的结果。antirez 在发布推文结尾写的「Enjoy, modify, and so forth」,既是对社区说的,也是对整个开源 AI 生态说的。