AREX Feed Article
Black Forest Labs 开放 FLUX 3 Action 权重:7B 世界动作模型与 SO-101、DROID 策略同日上线 Hugging Face
2026 年 9 月 23 日,Black Forest Labs(BFL)的官方 Hugging Face 上线,这批开放权重发布物当天即可获取:包括作为适配基座的 flux-3-action-base(7B 世界动作模型)、供两个策略共享的冻结视频变分自编码器(VAE)与 Qwen3-VL-4B-Instruct 文本编码器、带保存 processors 与 task-LoRA 配方的 SO-101 LeRobot 策略,以及根目录为经验证 BF16 策略、优化变体放在子文件夹的 DROID 策略仓库。
这批权重此前并未公开发布:,BFL 今年 7 月发布 FLUX 3 家族时,FLUX 3 Action 只向选定的研究和商业伙伴开放;发布当天 BFL 告诉 VentureBeat,会把权重、代码、微调配方、基准与可复现示例一并放出。BFL 的 同时给出性能声明:在 上微调后,FLUX 3 Action 以 42.92% 的任务成功率排在 RoboLab-120 榜首,这个成绩由 BFL 自己提交。
合集里有什么:文件清单、未改动的文本编码器与下载命令
把仓库内容列成一张表:动作基座 flux-3-action-base.safetensors、共享视频 VAE video_vae.safetensors、以及 text_encoder/ 目录下的 Qwen3-VL-4B-Instruct。基座共有 457 个张量,含视频流、文本流、一条共享动作主干和 ee50/gaming 两类动作头;要接新本体,就得训练自己的动作头。模型卡写得很明确:这是适配组件,不是完整的机器人策略。
文本编码器是 的未改动副本,按 Apache-2.0 许可发布,原模型卡与许可标注保留在 text_encoder/README.md。两个策略仓库都不复制编码器权重:写明仓库不含重复的编码器权重,两个冻结编码器在加载时自动从固定的基座仓库拉取,配置里自动引用这些共享路径。
模型卡给出了只取基座的下载命令:hf download black-forest-labs/flux-3-action-base flux-3-action-base.safetensors。三个仓库都落在 之下;GitHub 上独立的 训练与推理代码(覆盖数据准备、分布式训练、断点续训、导出和推理)另有自己的许可。发布次日查看,两个策略仓库页面的月度下载计数分别是 48 和 33,仍停留在两位数。
从选定伙伴内测到公开下载
按 VentureBeat 的梳理,BFL 是以 FLUX 图像与视频模型闻名的德国初创,由 latent diffusion 和 Stable Diffusion 背后的研究者创立。它此前已经碰过机器人:与瑞士的 mimic robotics 合作构建了 FLUX-mimic,用 FLUX 3 视频主干的表征控制机械臂做工业操作,VentureBeat 称该系统在奥迪生产环境中测试过。7 月发布 FLUX 3 家族时,Action 只在选定伙伴渠道内可用;这一次,开放权重把这条路推到了其他团队也能自己改模型的位置。
不过开放的范围有边界。VentureBeat 指出,这次发布材料没有宣布 Action API 或 API 定价,截至其发稿,BFL 公开的 FLUX 3 产品页仍把 Action 描述为面向选定伙伴逐步开放,BFL 的公开文档也主要把 FLUX 3 列为视频生成 API。VentureBeat 的结论是:对机器人团队来说,自托管加自行微调是目前的核心用法。
视频帧与动作在同一个序列里联合去噪
BFL 在 Hugging Face 的把 FLUX 3 Action 描述为开放权重的世界动作模型(World Action Model,WAM):它同时预测未来的视频帧和动作。架构是一个 7B 参数的扩散 Transformer,在多个机器人本体的动作数据上训练;一个冻结的视频 VAE 编码画面,一个冻结的 Qwen3-VL-4B 编码指令。动作是同一序列里的第二条 token 流——每个未来帧对应一个动作 token,每个本体有自己的输入投影和输出头;视频 token 和动作 token 在每个样本里共享同一噪声水平,一起被去噪。
博客描述的通用调用流程是:每次调用返回 32 个动作,可选附带 32 帧解码画面;实际控制时跳过解码,只执行开头几个动作,重新观察,再规划下一步。
训练与生态侧的合作也写在博客里:模型在 NVIDIA GB200 系统上训练,配套自定义内核用 NVIDIA 的 CuTe DSL 写成;BFL 与 NVIDIA 合作开发了 PEFT(参数高效微调)配方和面向 NVIDIA Jetson 的边缘部署,LeRobot 集成则由 BFL 与 NVIDIA、Hugging Face 三方共同构建,自带 PEFT 配方。
RoboLab-120 榜单:BFL 称高出此前最佳开放模型 6.1 个百分点
DROID 模型卡对基准的描述是:RoboLab-120 是 Isaac Sim 里的 120 个桌面任务,每个任务跑 10 次试验,使用 DROID 风格的 Franka 平台;只有按指令完成任务才算成功,完整榜单在 。BFL 给出的对比表中,FLUX 3 Action(WAM,7B)以 42.92% 居首;闭源的 OASIS WAM(VLM+WAM)39.0%;开放的 Cosmos3-Nano-Policy(WAM,16B)36.8%;Physical Intelligence 的 π0.5(视觉-语言-动作模型 VLA,3.3B)28.0%。
按 VentureBeat 的转述,BFL 称这一成绩比 RoboLab 此前最好的开放模型 Cosmos3-Nano-Policy 高出 6.1 个百分点,参数量只有后者(16B)的 44%,运行快 1.43 倍;BFL 还说蒸馏变体在「成功率-推理速度」之间确立了新的 Pareto 前沿,实时率(推理耗时与其控制的真实动作时长之比,越低越好)超过 π0.5,同时保持明显更高的任务成功率。
VentureBeat 写明,这些结果在发布前由 BFL 提交,其在上线前核查时,NVIDIA 公开榜单还没有把 FLUX 3 Action 列进去;VentureBeat 同时提醒,Ai2 的 MolmoAct 2(约 5B)和 NVIDIA 的 GR00T N1.7(3B)在另一套真实与仿真任务组合上评测,并不出现在 RoboLab 同一榜单里,机器人领域仍然没有一个能直接横比不同模型的统一基准。
SO-101 与 DROID:两条现成策略的合同与门槛
的观察与动作合同写在模型卡里:两个相机(observation.images.scene 和 observation.images.wrist,按此顺序),6 维状态/动作,关节增量动作加绝对夹爪;8 个观测、两个视觉快照与过往命令条件输入;每次预测 42 个动作、以 30 Hz 执行其中 32 个,然后重新规划。采样用四步 Euler、shift 6.93、guidance 3、种子 42、BF16;保存的 processor 管线和归一化状态文件随仓库分发,配置与 dataset_statistics.json 记录完整合同。它的训练数据是 的 SO-101 部分。仓库附带 lora.json 任务适配配方:rank-32 的 LoRA(低秩适配),bf16 混合精度,batch size 2,梯度累积 4,共 10,000 步,一条命令就能在自己的数据集上启动训练。
BFL 官方博客演示了这条策略的实际表现:在约 200 条遥操作剧集上适配,覆盖几个相关的拾放任务;演示里它把蓝盒子放进容器(4 倍速回放),有一次对螺丝刀先失手、再试一次成功,也处理了训练中没见过的容器和挪动过的机位。VentureBeat 拿到的采访记录里,研究人员这样描述:「模型先失败了,然后又试了一次,这次做得更好。」VentureBeat 同时提醒,这是公司挑选的演示,不能证明这种自我纠错能在不同机器人和环境里泛化。
的合同更重:三个 RGB 相机(wrist、left、right,映射回原 LeRobot 观测命名),图像为 CHW 3×360×640、取值 [0,1] 的浮点数,拼成 544×736 画布;状态是 7 个关节弧度位置加夹爪闭合比例;输出绝对关节命令加夹爪比例,以 15 Hz 出 32 个动作;归一化为恒等,夹爪反转和 2 倍动作缩放放在模型内部。采样用四步 Cosmos UniPC、shift 5、视频 guidance 4、动作 guidance 1。
优化变体是可选的:根目录是经验证的 BF16 策略(含 LeRobot 配置、模型和保存的 processors),variants/gd 是 4 步引导蒸馏,variants/sd 是 1 步步数蒸馏,另有对应的 FP8r 版本,三种配方乘两种精度共六个包,独立版 FLUX Action 全部支持;默认的 LeRobot 加载不会拉取任何变体权重。显存门槛也写在卡上:BF16 下约 32 GB GPU 显存(NVIDIA H200 实测),加 --quantize fp8 --offload-text-encoder 后可放进 24 GB 卡;测试环境为 Python 3.12、CUDA 12.8、torch 2.10.0、transformers 5.16.1。
安全边界两个模型卡写得直白:模型输出的是关节目标,没有任何机制约束关节速度、力度或工作空间,这些限制必须由应用层执行,并保留触手可及的硬件急停;在靠近人运行之前,先在仿真器或带安全限位的状态下验证。
打游戏、开无人机:同一套权重的三个改编样本
选游戏的原因博客说得具体:在硬件上评测单个检查点可能花掉一整个下午,游戏几分钟就能对脚本机器人打一次分。数据来自脚本机器人,每款游戏录 800 集,机器人只凭当前帧决策,它知道的,模型都看得见。GRUNT 是 256×256 的 Quake 风格射击游戏,四个动作(移动、横移、转身、开火);VECTOR 是 Out Run 风格赛车,三个动作(转向、油门、氮气)。60 秒同一种子下,GRUNT 里 FLUX 3 Action 打出 15 杀 0 死、命中率 86%,脚本机器人 13 杀 0 死、96%,随机策略 8 杀 2 死、13%;VECTOR 里它跑出 3.3 公里、1 次撞车、12 次超车,脚本机器人 3.4 公里、0 撞车、16 次超车。两张表用的是同一套权重:同时在这两款游戏上训练,靠字幕告诉它在玩哪一个。
无人机是第三个样本:256×256 机载相机,输出前进、横移、升降、偏航四个分量;800 次飞行由脚本飞行员在 NVIDIA Isaac Sim 里录制,指令是「起飞,从桌子底下飞过去,落到书柜后面」这类句子。博客写明,Isaac Sim 只产出这批微调数据,FLUX 3 Action 本身没有用仿真数据训练;测试在没见过的房间、没读过的句子上进行,沙发、书柜和杂物每次飞行都换位置,起飞朝向随机。
VentureBeat 报道,BFL 称这套方法可以扩展到仿真、游戏和计算机使用场景,同时把这些结果定性为早期实验,而非生产能力。报道最后把检验留给了外部团队:能否在自己的机器人上复现这些增益,以及 7B 参数加开放权重的组合是否实用到足以进入生产流程。