AREX Feed Article
MiniMax 官推背书 Sol Engine:H3 的 10 秒 768p 生成从 414s 压到 14.93s
2026 年 8 月 24 日 21:59 UTC(北京时间 8 月 25 日 5:59),MiniMax 官方账号 @MiniMax_AI 发推,转述并背书 NVIDIA SANA 团队针对开放权重视频模型 H3 的 Sol Engine 优化:4 步低分辨率 H3 草稿、3 步 LTX 目标分辨率精修、配合 Sol-Attn 的级联方案,把单块 GB200 上生成 10 秒 768p 视频的时延从 414 秒降到 14.93 秒,即 27.7× 加速()。
推文还给出两个更激进的说法:单节点月产 37.8 万条视频、GPU 毛利 97%+。口径需要先说明:这些数字来自模型方官方账号对第三方团队成果的转述,推文没有附带论文、仓库或演示链接,也没有给出可复现所需的完整参数;回复区已经有人直接索要输出视频、追问画质损失。
414 秒到 14.93 秒的级联配方
推文把方案拆成三段:先用 4 步在低分辨率下生成 H3 草稿,再用 3 步 LTX 在目标分辨率精修,精修阶段启用 Sol-Attn;同时用 TAEH3/TAEV 解码替换沉重的 VAE 解码,"在精修期间保持 latent 稳定"。推文称这是 "co-designing sampling topology with hardware kernel acceleration"(采样拓扑与硬件 kernel 加速的协同设计),并称"当推理时延这样坍塌,单位经济随之根本改变"。
草稿加精修的路线确实存在于 Sol Engine 项目内。8 月 21 日,署名 Junsong_Chen、简介为 "HKU Ph.D, NVIDIA Research Internship" 的账号 @lawrence_cjs 发推,称 "first draft then refine"(先草稿后精修)管线是 "SSSuper Fast Minimax H3 gemeration tech",并指向 Sol Engine 项目()。这与 MiniMax 推文描述的 4+3 步级联一致。但截至本稿核验,14.93s 与 27.7× 这两个数字仅见于 MiniMax 官方账号的转述。
同一项目页上的另一种口径:3.95× 近无损
NVIDIA 侧公开页面的口径保守得多。Sol Engine 的 H3 项目页()标题即 "Deploy MiniMax-H3 with Sol Engine: 3.95× Acceleration in 4.5 Hours":8 块 GB200、1344×768、24fps、124 帧、50 步,端到端墙钟时间从 27.205 秒降到 6.883 秒,宣称近无损,且不蒸馏、不 LoRA、不微调、无离线校准。
项目页把加速拆成三个叠加支柱:kernel 无损融合(fused RMS-AdaLN、QKV 合并、GEMM+GELU 融合等。H3 的 33B 参数中约 13B 位于每个去噪步都会触发的 AdaLN 分支,这是最大单项收益);cross-step cache(以 First Block Cache 门控复用上一步残差);Sol-Attn(免训练稀疏注意力,按 query 自适应阈值、在线路由、对被拒绝块做 Taylor 近似补偿)。
配方由 Sol Engine 的自动搜索在 4.5 小时内收敛:kernel、稀疏注意力、cache 三轴并行搜索,再由整合器组合候选。页面提供两档配置:quality preserving(只开 cache,LPIPS 0.210)与 super efficient(再开 Sol-Attn,多换 1.25×,LPIPS 0.293),均在 50 步下测得。Sol Engine 与 Sol-Attn 各自有论文(、)。
两套数字不是同一配置。3.95× 针对原版 50 步 checkpoint 做纯推理期优化;27.7× 改动了采样拓扑本身,7 步级联、换用 LTX 精修、更换解码器。把两个数字直接比较,会混淆两种不同的加速路径,它们也不能互相印证。
发布 24 天,H3 已是 Sol Engine 覆盖的第四个模型
被优化的对象本身很新。MiniMax 7 月 31 日在发布博客中推出 H3():文本、图像、视频、音频统一上下文的全模态生成模型,原生立体声,最长 15 秒、2K 分辨率,并宣布将在数日内开源权重。NVIDIA 项目页称 H3(Hailuo 3.0)为 33B dense omni-modal 模型,输出 4–15 秒、最高 2K/24fps、原生 32kHz 立体声。博客还给出价格定位:2K 下每秒价格不到主流模型的三分之一,768p 下不到主流 720p 的一半。
GitHub 仓库 NVlabs/Sana 的更新记录显示,8 月 3 日 "Sol Engine: Day-One MiniMax-H3 Acceleration" 上线,称 4.5 小时优化达到 3.95×,桌面硬件上最高 4.52×();项目页补充说,H3 在其权重上线当天就成为 Sol Engine 在 B200 上覆盖的第四个模型,前三个是 64B Cosmos3-Super(2.27×)、22B LTX-2.3(2.38×)、2B SANA-Video(2.77×)。8 月 5 日,简介为 "Staff Research Scientist at NVIDIA" 的 Enze Xie 发推展示桌面端结果:DGX Spark 上 3.92×(480p/5s/24fps)、RTX 5090 上 4.52×(720p/5s/24fps),同样基于原版 33B 权重、无蒸馏微调()。
MiniMax 这条推文因此更像公开背书:措辞是 "Huge respect to the team for setting a new engineering bar for our open-weights ecosystem"("为我们开放权重生态立下新的工程标杆"),把这项成绩写进自家开源生态的叙事。
27.7× 换走了什么:回复区里的画质质疑
推文没有附任何输出画面或链接。截至本稿核验,它获得约 1.4 万次浏览、211 个赞、150 次收藏和 14 条回复,其中最集中的问题正是画质:
- Hunter Gon 直接问:"TAEH3/TAEV 解码替换相对原 VAE 路径,对 768p 视觉质量的影响有多大?"()
- AI 艺术家 Machine Delusions 的批评更具体:"你会丢失大量数据,因为你切换权重做放大。初始 latent 基座在渲染全程不是同一套权重,微小的运动和元素会立刻丢失。"()
- byMAR.CO 试图确认机制:"先用 taeh3 解码低分辨率 MiniMax 输出,再用 ltx 编码做放大?"()
- TheRealZavo 要最直接的东西:"有输出视频可以参考吗?我想看看视觉效果如何。"()
- 乐观者也有。jaimesolis 认为 27× 是拐点:"推理在目标分辨率降到 15 秒以内后,整个产品层会从'研究炫技'进入实际部署。"()
- 一位用户在该推文下要求尽快修复远景人物与物体的模糊和伪影,称"发布修复这个问题的版本是当务之急"()。
- Dylan Matlow 晒出自己在 RTX 6000 Pro 上的渲染计时对比图,称"相对的时间节省能给你一个概念",并注明测试时同一块卡还在训练 adapter()。
- 也有用户不买账:"don't care. Optimize for consumer gpus"("优化消费级 GPU 吧")。()
质疑的共同落点是级联方案的机制:低分辨率草稿换权重精修,画面是否还属于同一个生成过程。这与推文使用的 "high-fidelity" 形成对比,推文把画质当作前提,回复区把它当作待验证项。
14.93 秒与月产 37.8 万条之间缺的账
推文把时延数字直接换算成商业结论:"a single node can suddenly serve 378K videos a month at 97%+ GPU margins",并称这标志着高保真 AI 视频从异步批量渲染走向近实时交互基础设施。
换算里缺了环节。14.93 秒是单条视频的时延,月产 37.8 万条意味着节点内必须多路并行渲染,推文没有说明批处理假设;"单节点"与"单 GB200"的对应关系同样未交代;97%+ 的 GPU 毛利需要收入与成本口径,推文只给了结论。这些数字没有被独立复现,推文也没有给出可复现所需的完整参数。
截至本稿核验,27.7× 仍是 MiniMax 官方账号转述的一个数字:没有附带论文或仓库链接,没有输出视频,回复里有人要的正是最基础的东西,"Any output video for reference?"。在可复现配置或输出画面出现之前,27.7× 停留在官方背书层面,无法当作可验证的基准。