AREX Feed Article
宇树宣布开源 6B 具身基础模型 UnifoLM-WLA-1.0,称在多个基准上领先开源模型
9 月 10 日 17 时 01 分(北京时间),,宣布将新一代具身基础模型 UnifoLM-WLA-1.0 全面开源。推文称,该模型在多个基准上取得全球开源模型中的新 SOTA(State of the Art,当前最优)成绩,并称单个模型即可协调桌面操作与全身移动操作,支持跨任务、跨末端执行器的泛化。
与公告一同上线的给出了更多数字:模型规模 6B 参数,训练使用约 2,500 小时真机数据,单个模型覆盖 64 项任务。项目页上,代码、模型权重与数据集的入口目前都标着「即将开放(Coming soon)」。
10 项全身移动操作、54 项桌面操作与真机评估
项目页称 UnifoLM-WLA-1.0 是「全面升级的下一代」人形机器人通用基础模型,并将其标为 VLA(视觉-语言-动作)模型。
任务方面,页面称单个模型覆盖 10 项全身移动操作与 54 项桌面操作,并支持两指夹爪与多款五指灵巧手。真机评估使用宇树 G1 人形机器人完成。
训练数据包括 Unitree Open Datasets 与 BitRobot-HIW-500。后者是一套 2026 年 6 月发布 V1 版本的开源数据集:据说明,数据在东南亚的真实住宅中采集,由人类对宇树 G1 进行全身遥操作,覆盖移动操作、双臂交互与长程家务技能,V1 包含 500 多小时数据。
基准对比表:7 项领先开源对手、9 项未居首
页面称,在 16 项多模态感知与理解基准中,UnifoLM-ER-1 有 7 项领先开源模型。这张对比表列出 23 个模型,UnifoLM-ER-1 位于首行;按表中数字,它领先的项目是 RefSpatial-Bench、Where2Place、Pixmo-Point、BLINK、EmbSpatial、RoboSpatial 和 VSR。
具体到分数:Where2Place 一项,UnifoLM-ER-1 得 82.0,开源模型中次高的 Embodied-R1.5-8B 为 74.0;Pixmo-Point 得 73.8,次高 64.8;EmbSpatial 得 88.9,次高 82.7(Hy-Embodied-VLM-1.0 30B-A3B);VSR 得 88.1,次高 84.0(RoboBrain2.0-7B);BLINK 得 93.4,次高 90.3(Cosmos3-Super-64B)。
有领先的列,也有未居首的列:Ego-Plan2 得 55.1,低于 Thinker-4B 的 63.7;VSI-Bench 得 54.2,低于 Molmo2-ER-4B 的 74.5;MME 得 2,223.3,低于 Qwen3-VL-8B 的 2,412.5。
页面脚注写明了统计口径:表中分数来自各模型的官方技术报告或公开论文;部分结果通过各模型官方 API 测试获得;BLINK 一列只取 Relative Depth 与 Spatial Relation 两个子任务的平均分,页面报告的结果均由宇树自行测试。这些分数针对的是 WLA-1.0 中负责感知与推理的 UnifoLM-ER-1(4B 版本,基于 Qwen3-VL-4B);桌面与全身操作的评估以真机演示视频呈现。
WLA-1.0 的构成:ER-1、动态区域预测与离散动作
按项目页的拆解,UnifoLM-WLA-1.0 由三部分构成。
第一部分是具身推理(Embodied Reasoner,ER)模型 UnifoLM-ER-1:以 Qwen3-VL-4B 为底座,训练样本超过 500 万条,涵盖图像点预测、目标检测、多图推理、2D 轨迹预测、3D 目标检测与多图空间问答,并与通用图文数据联合训练,在提升空间理解的同时保留通用视觉语言能力。
第二部分是动态区域预测:先用光流提取能体现未来场景变化的动态区域,再用 VQ-VAE(矢量量化变分自编码器)把这些区域编码成固定长度的离散 token(标记)序列;模型以当前图像加上任务描述或动作作为条件,直接预测未来动态区域的 mask token,把建模重点放在交互主体及其引发的场景变化上。
第三部分是离散动作学习:动作空间被拆成末端执行器(EEF)位姿、末端关节与下肢关节三部分,每部分单独训练一个残差向量量化(RVQ)模型;在 ER-1 基础上加入离散动作 token 和动态区域 mask token,得到 UnifoLM-ER-Flow,把视觉、语言、动作对齐进同一个 VLM(视觉语言模型)。
WLA-1.0 在 UnifoLM-ER-Flow 多模态骨干之外加了一个 MMDiT 动作专家,并通过统一动作空间支持跨本体的先验迁移。项目页称,它由此在具身操作能力与通用多模态感知、推理之间取得平衡。
前两代 UnifoLM 发布时都包含代码与权重
2025 年 9 月,宇树发布世界模型-动作框架 UnifoLM-WMA-0,其 的更新记录写着:9 月 15 日放出训练与推理代码及模型权重,9 月 22 日补充部署代码。2026 年 1 月 29 日, 发布训练与推理代码和模型权重。
回复区的问题:没见过的夹爪与「具身契约」
公告推文下的回复里,有两条针对这次的核心主张提出了疑问。用户 问,一个模型同时协调桌面与全身操作是难的部分,那么在没见过的夹爪几何形态下,WLA-1.0 还能不能保住跨末端执行器的收益。 则写道,开放权重只是第一步,机器人模型能否复现,取决于他称为 embodiment contract(具身契约)的一组条件——传感器标定、动作空间映射、控制频率与恢复策略;「同一份检查点装到另一只手上,可能就是另一个系统。」
也有用户 写道,开源之后,社区可以用陌生的任务、物体和环境来检验这套泛化能保持到什么程度。
跨末端执行器的收益能否在没见过的夹爪上重现,仍要等代码、模型权重与数据集开放后才能回答。