AREX Feed Article
同日截胡 Seedance 2.5,FLUX 3 把视频模型变成了机器人
TL;DR:8 月 4 日,Black Forest Labs 正式发布 FLUX 3 Video,首款视频生成模型。20 秒 1080p 原生音频、15+ 语言唇形同步、Draft 预览模式,定价 $0.17/秒。同一架构可以预测机器人动作。Audi 已在产线上跑通。开源权重"即将到来",目前通过 BFL API、Runway、Venice、OpenRouter 等渠道可用。同一天,ByteDance 的 Seedance 2.5 也发布了。
同一天,两家公司掏出了下一代视频模型
美国东部时间 8 月 4 日下午 1 点 29 分,Black Forest Labs 官方账号在 X 上发了一条推文:"FLUX 3 Video is here."
四个单词。313 次转发,2367 个赞,34.5 万次曝光。171 条引用推文。848 人点了书签。
几个小时前,ByteDance 的 Seedance 2.5 也发布了:30 秒 4K 单镜头、50 个参考输入、自动剪辑和多机位。两家的官宣推文在同一天内刷屏了 AI 开发者的时间线。
这不是巧合。AI 视频的窗口正在快速收紧。谁先拿出能用的产品,谁就定义接下来半年的创作工具格局。
FLUX 3 Video 的答案是:20 秒 1080p,原生音频,15 种以上的语言,精确唇形同步。Draft 模式让你花 $0.06/秒快速预览,满意后再花 $0.17/秒渲染成品。支持文本生视频、图片生视频、关键帧控制、视频续写和多镜头生成。
但真正让社区炸锅的,不是这些参数。
社区追着要开源权重,BFL 团队回了一句"还有更多"
BFL 官宣推文下最高赞的几条回复,几乎都在问同一件事。
"Flux 3 video 会有 dev 开源模型吗?"用户 @pokka_tech 提问,获 13 赞。
"等开源权重,作为 BFL 粉丝。"用户 @kriGetaa 附了一张 GIF,获 16 赞。
"Define 'Coming soon',是 Pro 版还是 Dev 版?"用户 @AoE4LV120 追问。
BFL 团队成员 @nousr_(前 Stability AI 研究员)在回复中写道:"非常自豪我们团队在这一次发布中做到的事情。每一天我们都在推动让每个人都能创造他们想象中的任何东西。"
Andreas Blattmann,FLUX 3 的项目负责人,在另一条推文中说:"这个模型可以做到其他模型做不到的、有创意又有点奇怪的事情。视频只是开始,还有更多在后面。"
但质疑声也不少。拥有 27.6 万粉丝的土耳其开发者 Furkan Gözükara 直言:"没用,MiniMax 免费开源,而且本地跑得很好。"另一位用户 @itswelski 则对比了 Seedance 的价格:"在这个价位,不如直接走 Seedance。但还是等开源权重。"
社区的核心焦虑很清楚:BFL 的开源信用来自 FLUX.1 Dev 和 FLUX.2 Dev,但那都是图像模型。视频模型的开源权重至今没有日期。
从 Stable Diffusion 旧部到世界模型:BFL 的两年跳级
Black Forest Labs 的故事起点是 2024 年。一群前 Stability AI 研究员在 Robin Rombach 带领下出走,创立了这家公司。
2024 年 8 月,FLUX.1 发布,12B 参数,迅速成为开源图像生成的事实标准。2025 年的 FLUX.2 进一步巩固了位置,FLUX.2 [klein] 9B 和 4B 让消费级硬件也能跑高质量图像生成。
然后,7 月 23 日,BFL 投下了一颗炸弹:FLUX 3,一个统一多模态前沿模型。不是图像模型的升级版,而是一个同时处理图像、视频、音频和动作预测的单一架构。
8 月 4 日,视频能力率先上线。图像生成"在未来几周内"。机器人动作控制,Audi 已经在用了。开源权重 FLUX 3 Dev,只有一句"敬请期待"。
这条路径和 Google DeepMind 的 Gemini Robotics 2 镜像对称。DeepMind 做了一个机器人模型然后给了它世界知识。BFL 做了一个视频模型,然后发现世界知识本来就在里面。
视频占 95% 算力,但真正值钱的是剩下的 5%
BFL 在发布博客中披露了一个工程细节:视频预测消耗了 FLUX 3 超过 95% 的训练算力。音频不到 0.5%。
但 BFL 把音频称为"简单模态"。低维度,与视频强耦合。模型学会视频之后,唇形同步和撞击音几乎是顺带学会的。
这正是整个 FLUX 3 架构的核心论点:不同模态是同一现实的不同投影。如果模型同时学习图像(空间关系)、视频(时间+运动)和音频(事件声学特征),它被迫学到的东西比任何单模态模型都更深。
证据来自人类偏好评测。BFL 内部测试显示:
- 对 Luma Ray 3.2:93% 的评测者选了 FLUX 3
- 对 Runway Gen-4.5:77%
- 对 Grok Imagine Video:69%
- 对 Kling v3 Pro:60%
- 对 Seedance 2.0:52%(五五开)
- 对 Gemini Omni Flash:52%(五五开)
与 Seedance 2.0 和 Gemini Omni Flash 打成平手,对 Runway Gen-4.5 大幅领先。BFL 公开了输的一方:Seedance 2.0 和 Gemini 各有约一半评测者更偏好对手。这种透明度在行业里并不多见。
更惊人的是机器人部分。FLUX 3 的视频路径上挂了一个轻量级动作解码器(FLUX-mimic),在软体装配任务上跑了 20 次自主试验:
- FLUX-mimic:95% 成功率
- 单任务 flow matching:70%
- FLUX-mimic(冻结骨干):65%
- π0.5 基线:55%
- π0.5(冻结骨干):0%
冻结 FLUX 3 的全部参数、只训练解码器,还能拿到 65%。冻结 π0.5 直接归零。世界知识不仅存在,而且可读。
Audi 生产实验室的 Christoph Schneider 在 BFL 公告中评价:"我们看到这些机器人解决了复杂的软体操控任务,这些任务用传统自动化根本不可能完成。"
20 秒 vs 30 秒:AI 视频的正面战场才刚开始
8 月 4 日这天,AI 视频赛道出现了罕见的同日对撞。
Seedance 2.5:30 秒单镜头、4K、最多 50 个参考输入、自动剪辑、音频。FLUX 3 Video:20 秒、1080p(2K/4K 承诺中)、原生音频、Draft 模式、机器人动作。
技术路线不同。Seedance 走的是"更长、更高清、更多参考"的创作者工具路线。FLUX 3 走的是"一个模型搞定所有模态"的平台路线。
分发策略也不同。Seedance 2.5 通过 ByteDance 自己的 Jimeng AI 和 Doubao Pro 分发,配以 Higgsfield.ai 等第三方。FLUX 3 第一天就铺到了 Runway、Venice、OpenRouter、Runware、LetzAI、fal.ai 六家平台。
价格方面,FLUX 3 的 $0.17/秒(720p)对应 Seedance 2.5 在第三方平台约 $0.23/秒(720p 带音频)。BFL 的 Draft 模式把预览成本压到 $0.06/秒,这是差异化打法:创作者不必为每一个失败的想法支付成品价格。
但 Seedance 2.5 的 30 秒原生时长和 50 个参考输入是目前所有模型中最激进的。FLUX 3 的 20 秒虽然够做一段完整的社交媒体剪辑或产品展示,但在需要长镜头的叙事场景中还差一截。
更关键的是开源战线。MiniMax H3 已经以免费开源的形式出现,评论区不断有人拿它来对比 FLUX 3。BFL 如果不尽快兑现开源权重承诺,AI 视频的"开源默认选项"可能就被别人占住了。
拥有 36.6 万粉丝的 MTS 日報在每日行情总结中写道:"新一代视频模型已经接近'我会看完一部纯 AI 生成的电视剧'的水平。"
FLUX 3 不只是一个视频模型
FLUX 3 今天看起来是一个视频生成工具。但 BFL 赌的是更大的事:视频模型就是世界模型——能看、能听、能预测下一秒会发生什么,然后把这些预测转成机器人指令。
那个在 Audi 产线上装密封条的机械臂,和那 20 秒里一个角色说话时嘴唇的每一次开合,跑的是同一个架构。
这场赌博的赌注不在 8 月 4 日的产品发布里。它在"开源权重,敬请期待"那六个字后面。
Sources: Black Forest Labs official blog (Aug 4, 2026), BFL X/Twitter announcement thread (@bfl_ai), eesel.ai analysis, kingy.ai report, OpenRouter pricing page, MTS daily recap (@MTSlive), community replies on X, Instagram Seedance 2.5 coverage.