AREX Feed Article
Seedance 2.5、MiniMax H3、FLUX 3、WAN 3 四模型同台,一句提示词分出四条路
8 月 7 日,模型托管平台 Oxen.ai 同时上线了四款本周密集发布的视频生成模型——ByteDance 的 Seedance 2.5、MiniMax H3、Black Forest Labs 的 FLUX 3 Video,以及阿里通义万相 WAN 3.0。Oxen 用同一句提示词对四款模型做了横向评测,把各自生成的视频并排展示,覆盖定价、开源状态、版权过滤和实际使用权衡。
四段视频全部基于同一个"奥德修斯风暴归航"场景。跑出来的差异不在画质排名,而在于四个模型对同一个提示词的处理方式完全不同——有的直接拒绝,有的默默生成,有的悄悄复现了演员的脸。
四句话写进四个模型,出来的不是同一个奥德修斯
Oxen 选了一句重氛围的提示词:。四个模型跑了同一个场景,但过程本身已经说明问题。
ByteDance 的 Seedance 2.5 在输入"Odysseus"时直接触发了版权过滤,提示词被拒。Oxen 作者 Eloy Martinez 在博客里写道:"拜托 ByteDance,《奥德赛》进入公共领域已经大约 3000 年了。"Oxen 判断这显然是 Seedance 2.0 时代 Brad Pitt vs Tom Cruise 版权风波的后遗症。换成"weathered Greek hero"后,Seedance 2.5 产出了评测中画质最好的 5 秒 720p 片段,费用约 1 美元。
MiniMax H3 的表现不遑多让。同样的奥德修斯提示词,2K 分辨率 5 秒生成花费约 0.65 美元,没有触发任何内容过滤。Oxen 的博客写道:"这无疑是个好模型,但我们可以训练它——这一点就把它远远甩在了竞争者前面。"
FLUX 3 Video 是 Black Forest Labs 的首款视频模型,8 月 4 日结束早期访问后全面开放。同一句提示词跑出的 5 秒 720p 片段费用约 1 美元,光感逼真,也没有版权标记。ilker——fal 平台的创意工程师——在 X 上比较了自己用两款模型生成的视频后写道,除了原始画质之外,FLUX.3"整体感觉更聪明、更好"。
WAN 3.0 最便宜但也最慢。5 秒 720p 花费 0.50 美元,生成耗时 8 分钟。Oxen 还注意到,这一版奥德修斯"由 Russell Crowe 扮演"——模型直接复制了某位演员的肖像。WAN 3.0 目前仍是闭源模型,尚未出现在 Artificial Analysis 的 Video Arena(基于盲测人类偏好的排行榜)中。上一代 WAN 2.2 是阿里最后的开源旗舰模型,Oxen 在博客里喊话:"我们想念你们的开源模型,阿里巴巴,请把它们带回来。"
"开源视频回来了"——MiniMax H3 最重的一拳不是画质
四款模型中,真正改变竞争规则的是 MiniMax H3。这是很长时间以来第一款在 Artificial Analysis 视频编辑榜单上排名第一的开源模型,同时文生视频和图生视频两项均进入前三——。8 月 3 日,MiniMax ,最高可本地运行 768p 输出,需要约 80GB VRAM。2K 路径保留在 MiniMax 自有 API 上,也就是 Oxen 平台跑的那条线。
开放权重意味着用户可以微调。Oxen 直接在平台上集成了微调功能,上传数据即可,不必碰代码和基础设施。对长期忍受 Seedance 内容审核的用户来说,这是一条绕开审查的路径。Oxen 在博客里写道:"我有预感,这将成为很多人的日常主力模型。"
社区反应速度印证了这一点。推上用户 在 8 月 6 日发推称,MiniMax H3 发布仅三天,Hugging Face 上已经出现了 4 步加速 LoRA;同时 B 站创作者 T8 发布了支持 ComfyUI 的适配版本和双时钟采样器,均已开源至 GitHub。推上用户 用 MiniMax H3 和 FLUX 3 做并排对比后写道:"MiniMax H3 正在碾压 FLUX 3。这很重要,因为 FLUX 3 一段 5 秒 720p 视频要花 2 美元,而 MiniMax H3 的成本只是你的 GPU 算力。"Smallzero 提到的 FLUX 3 定价($2)高于 Oxen 平台上的价格(约 $1),反映了不同平台的定价差异。
四个模型一周内全部到齐,不是巧合
回顾时间线,这场对撞几乎是被各家发布时间表推到同一周内的。
8 月 1 日,,首次实现单次生成 30 秒视频并内置音频。
8 月 3 日,MiniMax ,这一动作改变了模型的生态位——从又一个 API 产品变成了可本地部署、可微调的基础设施。
8 月 4 日,,宣称其在文生视频的人类偏好测试中超越了现有 SOTA 模型,在图生视频上与 Seedance 2.0 打平。
8 月 6 日,,以 30 秒单镜头连续生成、文档转视频和每秒 ¥0.3 起的 API 定价入场。
8 月 7 日,Oxen.ai 将四款模型一次性全部上线,发布横评博客。
这不是 Oxen 策划的擂台赛,而是各家不约而同在 8 月初集中亮牌后,Oxen 做了最直接的事——把四个模型拉到同一句提示词下跑一遍。
同一句提示词,四种定价和三种开放程度
如果只看生成效果,Seedance 2.5 仍然是画面质量的标杆——即便在被迫替换关键词之后。但四款模型在定价和开放性上的分化比画质差距更值得关注。
定价方面,以 5 秒 720p 片段为基准,WAN 3.0 最便宜($0.50),MiniMax H3 居中(2K 分辨率 $0.65),Seedance 2.5 和 FLUX 3 各约 $1——以上均为 Oxen 平台价格。MiniMax 还有一个免 API 费用的路径:本地部署。日本用户 在 8 月 3 日报告,使用 RTX 4090(24GB)在 ComfyUI 上成功生成了 15 秒完整带音频视频,耗时约 9.6 分钟。
开放程度上,只有 MiniMax H3 开源。Seedance 2.5、FLUX 3 和 WAN 3.0 目前全部闭源。FLUX 3 的开放权重版本(FLUX 3 Dev)在路线图上但无确定日期;阿里上一代开源模型 WAN 2.2 之后,3.0 重返闭源路线;Seedance 则从未开源。
内容限制方面,Seedance 2.5 的版权过滤最为激进——连"Odysseus"这个公共领域名字都被拦截。FLUX 3 和 MiniMax H3 在 Oxen 的测试中没有触发过滤。WAN 3.0 虽然也没有拦截提示词,但生成结果直接复现了演员 Russell Crowe 的面孔,把肖像权问题推到了台前。
速度方面,WAN 3.0 的 8 分钟生成时间明显落后于其他三款。Oxen 没有公布其他三款的精确生成耗时,但从社区反馈来看,MiniMax H3 在高端 GPU 上已经可以做到分钟级出片。
视频模型的竞争从"能不能跑"变成了"往哪跑"
半年前,Seedance 2.0 发布后一度在画质上没有对手。Oxen 写道:"感觉已经过了好几年,我们才看到一个能与之竞争的模型(它大约六个月前发布,公平地说,在 AI 世界里这确实是好几年)。"
现在局面完全不同。四款模型在同一周上线,高质量视频生成不再是单一供应商的特权。竞争的维度裂变成了至少四条线——画质天花板(Seedance)、开源可定制(MiniMax)、多模态逼真感(FLUX)、以及低成本长镜头(WAN)。
拥有 4.8 万关注者的 AI 动画创作者 在 X 上发布了 FLUX 3 与 Seedance 2.5 的对比视频后写道:"差距不是接近的问题,而是根本不在一个方向上。"这条推文获得了约 3 万次浏览。
开源模型激活生态的速度,是闭源 API 无法复制的。发布仅三天,MiniMax H3 的 ComfyUI 适配方案和加速 LoRA 已由社区开发者完成并开源。
另一个隐含的转折:四款模型全部支持多模态输入——文字、图片、视频、音频可以混合作为输入。显示,FLUX 3 支持在单次生成内切换场景和机位、渲染文字排版以及多语言口型同步。多模态输入正在从差异化功能变成入局门票。
下一个问题不是谁更好,而是你愿意接受哪种妥协
四款视频模型同时出现在 Oxen.ai 的同一个页面上,没有哪个在所有维度上胜出。Seedance 2.5 画质最好但锁得最死;MiniMax H3 最自由但本地部署有硬件门槛;FLUX 3 光感最自然但最贵;WAN 3.0 最便宜但最慢,还可能在肖像权上踩雷。
选模型不再是一个技术问题,而是一个取舍问题:你更在意的是自由度、价格,还是极致画质。