AREX Feed Article
PFN CEO 冈野原大辅:GEN-1.5 是机器人界的 GPT-3 时刻,商用部署需 99.99%
东京时间 8 月 21 日上午 8 点 14 分(UTC 8 月 20 日 23:14),Preferred Networks 联合创始人兼 CEO 冈野原大辅(Daisuke Okanohara,X 账号 @hillbig),深度解读机器人基座模型 。他确认,GEN-1.5 能仅凭 3–12 秒的单次演示、在不更新任何模型参数的情况下执行此前未见过的操作任务,10 个未知任务的平均成功率 59%。
他把这一刻比作语言模型界的 GPT-3 登场,同时用一组算术给出量化质疑:10 秒一个作业周期、24 小时连续运行,99.99% 的成功率仍意味着日均约 0.86 次失败;要平均每天失败少于一次,成功率需要约 99.99%,若要求几乎每天零失误,则要 99.9999% 以上。验证与质疑,出现在同一条推文里。
一段 3–12 秒演示,不更新参数,成功率 59%
冈野原在推文中复述了 GEN-1.5 的核心机制:与以往机器人基座模型"每个新任务都要追加训练"的做法不同,GEN-1.5 只需把数秒演示当作上下文(Generalist 称之为 Physical Prompting,物理提示),就能当场执行新动作。他列举的示例任务包括拉开拉链、拧开瓶盖、从容器倒出物体、从钱包取出纸币,每个任务只给模型看 3–12 秒演示,模型参数不做任何更新。
"现在报告的精度是 10 种未知任务平均 59% 的成功率,"他写道,"对实用来说还是低水平,但意义在于:对未知任务,无需追加学习就能以闭环控制执行。"
Generalist 的发布博客给出了同样的数字和更细的口径:10 个多样化任务上,one-shot in-context prompting 平均成功率 59%(标准差 ±10%);在 few-shot 设置下,每任务 5 分钟数据(约 50 次演示)、10 步梯度更新后,成功率升至 83%(±9%)。博客同时承认,任务本身简单、时程短,成功率并不高。GEN-1.5 是一个大尺度多模态模型,处理 30 秒视频记忆(连同传感器、语言和本体感觉输入),输出 100 Hz 的动作轨迹。
"GPT-3 时刻"的根据:50 万小时真实动作数据
"这是与 LLM 中 GPT-3 登场时相同的瞬间,"冈野原写道,"在数十万小时规模的动作数据上预训练之后,当场适应新任务的能力开始显现。"
这个类比不是他一个人的。Generalist 博客开篇就拿 GPT-3 做参照:语言模型的 one-shot 上下文学习是 GPT-3 的标志性能力(广泛语言任务上 one-shot 平均约 45% 准确率、few-shot 约 65%);GEN-1.5 是"我们所知的第一个"在广泛灵巧闭环物理任务上涌现 one-shot/few-shot 学习能力的模型,而且这些能力没有任何显式训练痕迹:没有为上下文学习改架构,没有内层或外层 meta-learning 循环,没有辅助目标。
规模数字来自冈野原推文援引的过往公开信息:GEN-1 时代就使用了超过 50 万小时、由人类穿戴设备采集的真实世界动作数据,预训练约 9 个月;预训练规模扩大使 Next Action Prediction Error(下一动作预测误差)下降,并与实机任务成功率改善相关。GEN-1.5 的预训练则已连续运行超过 8 个月。
冈野原特别强调了一个反直觉的结果:预训练不含任何仿真数据,但把仿真中录制的演示作为上下文提示,模型能在真机上执行。结合"人演示、机器人执行"的案例,他认为模型不像是在复制演示轨迹,更像在推断要达成的目的和技能、针对当前状况生成动作,可以用"从上下文推断潜在任务的 Bayesian Meta-Learning"来理解。博客还把演示选择做成了拖拽界面,并展示两个不同任务的演示可以组合成一段连续行为,冈野原由此推断,未来机器人的程序可能写成 Physical Prompt 的组合。
日均 0.86 次失败:商用部署的算术题
推文后半部分,冈野原把话题从能力里程碑转到现场实用,算了一笔账:
- 10 秒完成一次作业、24 小时连续运行,每天 8,640 次,全年约 315 万次;
- 成功率 99%,平均每天失败约 86 次;
- 成功率 99.99%,平均每天仍失败约 0.86 次。
"因此,仅要求平均每天失败少于一次,就需要约 99.99% 的成功率;如果要求几乎每天一次都不失败,则需要 99.9999% 以上。"
他也列出了可以放宽要求的条件:失败不致命、能自主恢复到原状态、后道工序能检查成功与否。但他随即补了一句:"很多真实世界作业连简单重置状态都很难,多工序任务里,每道工序的精度都要足够高,整体成功率才上得去。"对照 GEN-1.5 当前 one-shot 59%、few-shot 83% 的水平,失败率从 41% 降到 0.01%,是几千倍的差距。
把例外留给人类:他开出的实用化路线
在冈野原看来,GEN 系列本身已经大幅压缩了部署成本。GEN-1 时代,基座模型学会一个新任务还需要约 1 小时追加数据;GEN-1.5 把这一步压缩成上下文学习。博客的 few-shot 实验更极端:1–10 个梯度步、1–5 分钟数据即可适应新任务,10 步后权重变化不到 0.15%,单步(1 分钟数据)在某个留出任务上就能达到 66.5%。
后续把成功率推上去,他给出的路径是"LLM 式"的:继续扩大预训练,在 In-Context Learning 之外叠加 Fine-tuning,再像 LLM 一样加入 SFT、RL 等事后训练。
在模型精度追上来之前,他建议用环境设计补位:人与机器人一起作业、人类只负责例外处理,或者把机器人限定在失败容易检测和恢复的工序上。"一段时间内,在推进模型精度提升的同时,如何设计'即使不完美的机器人也能产生价值'的作业环境,也是实用化的重要课题。"这是他推文的最后一段判断。
"谨慎乐观,但这是机器人界的好日子"
在冈野原发文前约 7 个半小时(UTC 8 月 20 日 15:48),NVIDIA Director of Robotics & Distinguished Scientist、GEAR 实验室联合负责人 Jim Fan(@DrJimFan),两份解读各自独立成文。Jim Fan 说围绕 GEN-1.5 的 hype 浪潮"理所当然"(rightfully so),对 Pete 与 Andy 的执行力表示敬意;他把能力来源归因于人类采集数据中天然重复的动作模式(对称结构与失误后的恢复),并认为 UMI 式"人直接穿戴夹爪采集数据"会取代遥操作。
与冈野原"GPT-3 时刻"的定性相比,Jim Fan 的措辞更谨慎:"我持谨慎乐观。不过,这仍是机器人领域的好日子。"
冈野原在推文里留下一处留白:GEN-1.5 的训练细节,本次发布文章并没有充分披露,他能转述的仍只是 Generalist 报告的数字。Generalist 自己则写道,预训练曲线"还没有看到在哪里见顶"。
参考链接
- 冈野原大辅的推文:
- Generalist 博客《GEN-1.5: Embodied Foundation Models are One-Shot Learners》:
- Jim Fan 的推文: