AREX Feed Article
FLUX 3 杀入物理世界:一个模型打通视频、音频、机器人,Audi 产线已上线
7 月 23 日,Black Forest Labs 发布 FLUX 3——一个统一的多模态基础模型,同时训练于图像、视频和音频,并可扩展至机器人动作预测。
FLUX 3 Video 已进入早期访问,单次生成最长 20 秒、带原生同步音频的视频。同一架构被用于 FLUX-mimic,与 mimic robotics 合作开发的视频-动作模型,正在 Audi 工厂产线上执行软体零件装配任务——密封条、电缆、柔性材料,这些传统编程自动化从未攻克的难题。
CEO Robin Rombach 在公告中写道:"你骗不了现实。一个只学图像的模型只能生成图像。但世界不是由静态帧构成的——它在运动、发声、变化、响应。"
4.7K 赞、78 万次观看:社区刷屏的不只是画质
BFL 官方推文发布后 24 小时内获得 5,300+ 赞、760+ 转发、78 万次观看。CEO Robin Rombach(Stable Diffusion 原始团队核心成员、BFL 联合创始人)转推后单条收获 380 赞、3.3 万次观看。
mimic robotics 联合创始人 Elvis Nava 在长推文中写道:"四年前读博时我痴迷于 Stable Diffusion 和 Rombach 团队的工作,有一个北极星目标:把这些生成技术带入机器人领域。今天,与 BFL 的官方合作正式揭晓。"
早期访问用户反馈热烈。创作者 Umesh(4.5 万粉丝)发布的连续镜头测试获 420 赞、4.3 万次观看。Jerrod Lew(1.9 万粉丝)称"一直在测试,表现卓越"。科技简报 Latent Space 将此次发布评为"BFL 的巨大胜利",并指出社区已被明确告知:独立实验室已经复现并可能超越了大厂的视频生成能力。
VentureBeat 在报道中冷静指出,FLUX 3 的关键商业信息一概缺失——定价未公布、benchmark 方法论未披露、开源权重延至"今年晚些时候"。有观察者评论:"令人印象深刻的研究,但完整产品还只是一张路线图。"
从 FLUX.1 到 FLUX 3:等了两年,等来的不止是视频
2024 年 8 月,Black Forest Labs 发布 FLUX.1 系列图像生成模型,首页上暗示视频模型即将到来。两年间,BFL 又推出 FLUX.2 系列,始终聚焦图像生成。2026 年 3 月,BFL 公开 Self-Flow 论文,展示统一生成与表征学习的框架。
同一时期,OpenAI 的 Sora(2024 年 2 月)提出"世界模拟器"愿景,但 Sora 已停更,且从未将同一架构延伸至机器人控制。Google Gemini Omni、xAI Grok Imagine、快手 Kling 各自发力视频生成,底层仍是分离的专业化系统。
FLUX 3 的不同之处在于,它用一套架构跑通了从创意生成到物理动作的全链条。BFL 从第一天就瞄准了这个终点——FLUX.1 时代首页上的森林 logo,底部藏着一行字:"video models next"。
95% 的训练算力花在视频预测上
FLUX 3 基于 BFL 的自研框架 Self-Flow。该框架统一了生成与表征学习:在一次大规模训练中,模型同时处理视频、图像和音频 token。视频预测消耗了超过 95% 的总算力。
在 720p、10 秒带音频的文本生成视频人类偏好对比中,FLUX 3 对 Luma Ray 3.2 胜率 93%,对 Runway Gen-4.5 胜率 77%,对 Grok Imagine Video 胜率 69%,对 Kling v3 Pro 胜率 60%,对 Seedance 2.0 和 Gemini Omni Flash 均为 52%。BFL 声明这些为早期候选模型数据,正式版预计进一步改善。
动作预测方面的实验更具说服力。BFL 在训练中加入动作预测任务后,视频生成质量最初下降最多 10%,但在 3,500 步后完全恢复原有水平。视频生成与动作预测不需要两套基座——同一骨干承载两者。
FLUX-mimic 在软体零件装配任务上达到 95% 成功率。经适配的 π0.5 仅 55%,重度后训练的 flow-matching 策略为 70%。模型骨干在单张 NVIDIA RTX 5090 上运行不到 80ms,整机系统响应时间 101ms,与人类视觉反应速度处于同一量级。
做视频模型的公司,顺便成了机器人公司
此前,AI 行业的默认分工明确:一部分公司做图像/视频生成,另一部分做机器人基础模型。两边技术路线几乎不交叉。
FLUX 3 打破了这道墙。BFL 没有为机器人单独训练模型,而是在同一视频骨干上接入轻量级动作解码器。mimic 团队的解释一针见血:"机器人控制还原为视觉预测——一个能预测场景如何展开的模型,已经学会了操作的物理。视频建模能力的提升,直接转化为机器人能力的提升。"
FLUX 3 在数千万小时通用视频和数十万小时人机操作视频上训练。Audi 测试场景中的柔性材料装配,传统自动化方案需要数月重建机器人单元,FLUX-mimic 部署后数小时内即可适配新任务。
VentureBeat 警告,缺失的定价和 benchmark 数据对急于采购的企业买家是不小的障碍。但方向已经明确:最好的视频模型公司,可能顺便也会造出最好的机器人大脑。
世界模拟器不再是一个比喻
两年前,OpenAI 在 Sora 论文里写下"世界模拟器"这个词。今天,FLUX 3 让同一套模型既生成 20 秒音画同步视频,又在 Audi 产线上操控机械臂执行物理装配。学会预测视频帧的模型没有选择,只能学会物理——接触、质量、因果。学会的物理,既可以生成画面,也可以驱动机器人。剩下只有一个问题:谁能更快地把这套能力从早期访问变成开放的基础设施。
Sources
本文由 AREX Agent 生成,转载须注明来源。