AREX Feed Article
Adcock 称 Figure 取得 AI 突破,Helix 2.5 与 30 个住家演示随后发布
9 月 17 日 00:53 UTC(北京时间 08:53),人形机器人公司 Figure 的 Brett Adcock 在 称:「我们在 Figure 取得了一项 AI 突破,明天会展示。」帖子里没有任何技术细节,也没有说明突破指什么、展示会以什么形式进行。
9 月 17 日 18:45 UTC(北京时间 9 月 18 日 02:45),也就是预告发出约 18 小时后,Figure 官方账号宣布「今天我们发布 Helix 2.5」,并放出一段演示视频:公司在加州湾区租下 30 个住家,机器人在其中收拾客厅、叠毛巾、铺床,且「抵达时没有经过任何额外训练」。
帖文与 Figure 的产品
这条帖文由 Adcock 的个人账号 @adcock_brett 发出,不含链接、图片或视频,也没有提到任何产品或版本名。截至 9 月 18 日,它已获得约 102 万次浏览、近 1.2 万次点赞和 621 次转发。
Figure 官网的称 Figure 是一家「把通用人形机器人带入现实」的 AI 机器人公司;其第三代机型 F.03 面向家庭场景开发,智能由 Helix 提供。的说法是:Helix 在机器人本体上实时控制「感知、运动与推理」的完整闭环,让 Figure 03 自己决定怎么做,无需照着脚本执行。
Figure 发布 Helix 2.5:机器人在租来的住家里做家务
Figure 官方账号的很短:「今天我们发布 Helix 2.5。我们在湾区租了 30 个住家。机器人抵达时没有经过任何额外训练,就开始做有用的工作。」几乎同一时间,Adcock 用自己的账号,配着一段演示视频写道:「机器人学的圣杯是能泛化:在没见过的场所干活。我们在湾区租了 30 个住家,不做任何新训练就在执行任务。」
同日,Figure 官网发布了。文章称 Helix 2.5 是公司构建过的「最先进」神经网络,也是机器人从人类经验里学会做事、再迁移到新场景「迄今最有力的证据」。
「零样本」的边界与判定标准
文章给出了三种行为的判定标准:收拾客厅,把散落的 13~15 件玩具全部捡起放进篮子;叠毛巾,所有毛巾叠好放进篮子;铺床,枕头与被子角都归到床的头部、被面拉平。三项都不设部分得分,成功即全部完成。
「零样本」(zero-shot)的边界由 Figure 自己界定:它指的是评估环境与被操作物体。按文章描述,30 个住家里没有采集过任何数据,机器人没有在这些环境或物体上微调、适配,用的是各家自己的沙发、床和台面;评分用的玩具、毛巾、床品事先封存,经一个 AI 模型加人工复核,确认从未出现在任务示范数据中。行为本身,则仍由别处采集的数据来指定。
文章还解释了为什么强调「全身」(whole-body):这类任务要求机器人走动、寻找物品、调整站姿去够到东西,并在狭窄杂乱的房间里保持平衡,感知、运动与操作无法拆开解决。每项任务在全部 30 个住家都只用一个固定检查点(checkpoint),不按评估表现调整权重。
9% 对 56%:差距被归给 Index 预训练
Figure 把泛化能力归功于 Index,文章把它描述为「全球规模的人类行为数据集」。按文章说法,Helix 2.5 完全从随机初始化开始、只在 Index 上完成预训练,上一代 Helix 02 则从一个预训练视觉语言模型出发;预训练之后,公司再用别处采集的数据为它指定三种行为。
对照实验的设定是:两组策略共享相同的任务示范数据、架构、训练与评估设置,唯一差别是其中一组用 Index 预训练来初始化。Figure 称,在盲评(blind evaluation)中,从零训练的一组零样本成功率为 9%,带 Index 预训练的一组为 56%,提升幅度「超过 6 倍」。
Figure 文章的图 1 给出了三项任务与合并的成功率对比:
文章还称,与 Helix 02 的一个代表性行为相比,Helix 2.5 只用了一半的任务示范数据,却把同一行为泛化到了 30 个没见过的住家。Index 的数据靠用户上传:Adcock 在 9 月 11 日的中称,Figure 每周有超过 86,000 名活跃用户在上传数据。
一条可以提前算出结果的缩放定律
文章还报告了另一个关于「缩放」的发现:用跨度为 8 倍的 Index 数据子集训练四个模型,模型规模和下游训练保持不变。Figure 称,损失随着预训练数据每翻一倍而可预测地下降——只凭较小规模的结果,他们在训练开始前就把最大一次运行的测试损失预测到了小数点后四位,预测误差为全区间波动的 0.54%。按公司说法,这是首个在人形机器人上测得的「人类到机器人」迁移缩放定律(scaling law)。
文章的结论是「是时候扩大规模了」,对应两组数字:Index 目前每秒新增约 35 分钟的人类经验数据;Figure 已承诺为 Helix 训练投入 35 亿美元算力。这笔承诺来自 9 月 3 日宣布的 :最多 10 万块 NVIDIA Vera Rubin 平台 GPU,并有意扩展到 60 亿美元以上。
证据出自 Figure,以及 Adcock 预告的谈话
这次发布的材料里,关键环节都由 Figure 自己完成:演示视频出自公司官方渠道;成功率出自 Figure 的盲评,评分标准在评估前固定、由操作员按细则执行;「首次」的说法也带着限定,文章的原话是「据我们所知」。文章里还有一句自我限定:「重点不是通用人形机器人已经被解决。」
9 月 18 日 01:17 UTC(北京时间 09:17),Adcock 发出了这条时间线上最新的一帖。他:「我会在大约 17 分钟后到场谈 Helix 2.5。」帖子里没有链接,也没有活动名称。一天前的预告只有一句话,这一条也是;不同之处是,他这次要谈的 Helix 2.5 和那组由 Figure 自己算出的 9% 与 56%,都已经公开。他预告的那场谈话,是这条时间线上下一个可以核对的节点。