AREX Feed Article
智象未来发布具身世界模型 HiDream-O1-Embodied,自称以 0.692 登顶 RoboColiseum 扰动适应子榜
9 月 7 日,智象未来(HiDream.ai)正式发布具身世界模型 HiDream-O1-Embodied,并宣称该模型首次参评具身智能评测平台 RoboColiseum,即在 Robustness(扰动适应)子榜单以平均分 0.692 登顶榜首。公司介绍称,模型主打强化机器人的物理感知与动态预判,目标是让具身智能在真实环境中完成更高阶的物理交互。当天以快讯形式报道了发布与榜单成绩,在署名「机器之心Pro」的「机器之心发布」栏目刊出长文《大模型企业「跨界」具身即登顶榜首!智象HiDream具身世界模型来了》。
两篇报道相互印证了发布日期与 0.692 这个数字,但内容都出自智象未来自己的公告口径:机器之心长文中的演示视频、能力描述与 CTO 引述都出自智象未来的发布口径;界面快讯只有一句转述。两篇报道都没有提供第三方评测或独立测试数据。目前可以确认的事实只有「一家公司发布了模型并自称登顶」,0.692 分尚未经过任何独立核验。
上线不到一个月:四张子榜、78 个任务
RoboColiseum 是智象此次参评的具身智能仿真评测平台。据(经 36Kr 英文站刊发),该平台由高校、科研机构、开源社区、机器人企业与模型企业多方共建,定位是建立「结果可信、过程可复现」、与真机表现高度一致的常态化仿真评测体系。
平台共设四张能力子榜:指令跟随、空间理解、扰动适应与通用操作,对应 78 个高保真仿真评测任务、3,000 多个泛化用例;自内测以来已有 40 多个国内外团队在平台上开展训练与评测。平台项目负责人吴莫在采访中给出两组一致性数据:仿真评测与真机部署的相关性为 89.5%,同一模型在仿真环境与真实世界的评测差异不足 10%。每项任务还会被拆解成子步骤,记录模型完成到哪一步、在哪一步失败,方便追溯原因。
智象宣称登顶的扰动适应子榜,考的是模型在「非理想环境」下的表现。按公司发布材料的介绍,该子榜通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令做多样化改写,检验模型在环境扰动下的稳定性与泛化能力;材料称这是四个维度中「最具挑战性」的一环。平台今年 8 月才正式上线,从上线到智象 9 月 7 日宣布登顶,相隔不足一个月。
演示视频:在杂物堆里找三棱柱
发布材料对「具身世界模型」的定义,是直接与物理世界的规则和约束对齐,把视频生成能力转化为动作控制能力:球被抛出后如何下落、机器人抬起杯子时液体是否会洒出、抓生鸡蛋该用多大力,都属于模型要学的物理约束。随发布材料放出的一段演示视频,被机器之心文章称为「pick block shape」任务的头部视角实录:桌面上堆着杂物,机器人按指令执行抓取,材料给出的示例指令是「右臂拿起桌面上的三棱柱」。
这段演示设置了层层考验:先从杂物堆里找出三棱柱,再实时算出它的三维位姿,最后规划一条稳当的抓取轨迹;测试中人为加入了光影晃动、局部遮挡与纹理混淆等干扰。按机器之心文章对视频的描述,大多数情况下模型能一气呵成完成「认出—定位—抓起」。
演示也展示了模型理解指令的方式。材料称,传统机器人对指令的理解停留在关键词匹配:「把杯子拿过来」能听懂,换成「给我拿个杯子」或「杯子递我一下」就可能失效;HiDream-O1-Embodied 则覆盖包含多元动词、句式与表达方式的「等价指令空间」,只锁定意图本身,不受句式束缚。
一处失灵,其他视角顶上
在指令理解之外,发布材料的另外两项设计分别落在视觉与训练环节。视觉上采用多视角协同:相机位置可能偏移、标定精度随时间变化、单路画面可能被遮挡,模型综合多个视角的信息,当部分视觉信息失真或暂时不可用时,仍能借其他视角理解场景、继续执行,把「一处失灵、全局失效」变成「局部受限、整体仍可运行」。
训练上主动引入非理想条件:光照变化、画面污损、视野遮挡、信号波动都被放进训练阶段,让模型反复面对不完整、不稳定的信息,学会从有限线索中作出可靠判断。材料称,这种容错不只针对某一种视觉异常,面对光照、外观和场景变化,模型都能减少环境变化对任务执行的影响。
与诺亦腾合作:动捕数据扩增「百倍级」
支撑上述能力的,是公司称为「真实基座 + 生成增强」的数据生产范式,与动作捕捉公司诺亦腾的合作是发布材料给出的样板:诺亦腾的高精度真人动作捕捉数据作为「真实底座」,智象用其原生全模态能力完成「百倍级」的数据精细化扩增,基于单段真实动作样本生成变体视频,在严格保持物理约束不变的前提下切换背景环境、光照条件、物体形态,产出大量多元训练样本。
发布材料把这一机制概括为「模型既做‘考生’,也做‘出题人’」:模型根据自身所需主动生成针对性训练样本,形成数据与模型互相驱动的循环。智象称,高质量数据是具身训练中最稀缺、最具决定性的变量,这套数据策略才是其冲榜的真正基础。
从图像模型到具身模型,一个月内两次自称登顶
具身模型是智象产品线的延伸。其将旗舰产品 HiDream-O1-Image 描述为开源统一图像生成基础模型,展示 8B 开源版在多个图像生成基准上的成绩,并给出 diffusers(Hugging Face 的开源推理库)调用示例;机器之心长文正是在这个意义上把本次发布称为「跨界」。
按发布材料的说法,发布 HiDream-O1-Embodied 前不到一个月,智象刚推出交互式世界模型 HiDream-O1-World,并在交互式视频世界模型评测基准 WBench 的 Navi 分榜以平均分 80.9 自称登顶。材料将两款模型分工为:交互式世界模型解决「理解与推演」,具身世界模型解决「操作与执行」,并称家族线沿 HiDream-O1-Image → HiDream-O1-World → HiDream-O1-Embodied 延展,逐步覆盖视觉模型、交互式世界模型与具身世界模型,打通图像、视频、3D、动作等模态,贯通「理解—推演—执行」全流程。
智象未来 CTO 姚霆在发布材料中解释这条路线:「我们相信,围绕真实世界的表达、理解和生成,构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座……HiDream-O1-Embodied 的发布,是这一技术战略从‘模拟世界’迈向‘真实世界’的关键里程碑。」材料还转述了创始人兼 CEO 梅涛博士此前的判断:下一代大模型竞争的关键在于从单模态走向多模态,并走向原生统一的全模态。
同一张榜上两份「第一」,都在等复现
同一张榜单上的「厂商自称第一」不止智象这一份。8 月 25 日,GigaAI 团队以 Apache 2.0 协议开源了 3.5B 具身 VLA(视觉-语言-动作)模型 GigaBrain-0.7;据,其官方亮点同样自称在 RoboColiseum 全部四项评测中位居第一。该报道同时点明:这些数字全是自报,RoboColiseum、RoboTwin 2.0 与 EBench 的评测代码当时仍躺在 GigaBrain 仓库的 TODO 清单里,第三方复现没有入口。两份「第一」声明相隔不到两周;平台宣称评测结果实时更新,先后登顶在时间上可以并存,但都没有公开可核验的评测记录。
两家媒体的转述里指向公开核验的线索,只有发布材料对该平台「面向全球开放、实时更新评测结果」的介绍。如果这条介绍属实,外界可以直接打开榜单核对 0.692 与排名;但两篇报道都没有给出榜单链接,也没有列出同榜其他模型的分数。智象未来是否会像 HiDream-O1-Image 那样公布权重或开源代码,报道同样没有交代。在平台放出可核验的榜单记录之前,这个分数与「登顶」只能按厂商自报成绩对待。