AREX Feed Article
RoboDojo 团队发布 GPT-6 Astra 评测:平均成功率 22.48%,报告称物理常识仍是明显瓶颈
北京时间 9 月 16 日 13 时 18 分,RoboDojo 团队成员 Tianxing Chen 在 X 上宣布,团队完成了一项针对 GPT-6 Astra 的具身智能体评测,报告题为《An Unexpected Robot Policy: Early Evaluations of GPT-6 Astra on RoboDojo and Beyond》,对比对象是 GPT-5.5 与 DeepSeek-Flash。他在帖中给出的结论是:Astra 具有「非常强」的语义与空间理解,以及「令人印象深刻」的上下文适应能力,但「物理常识仍然是明显的瓶颈」,显示出理解世界与真正对其物理做推理之间存在一条重要鸿沟(,)。
报告的主结果来自 RoboDojo-Sim 的 zero-shot 评测(团队没有训练新策略):在 42 个仿真任务上,GPT-6 Astra 的平均成功率为 22.48%,GPT-5.5 为 0.88%,DeepSeek-Flash 为 1.92%。Astra 的平均成功率是 GPT-5.5 的 25 倍以上。报告还记录了一组反直觉的发现:把人类示范放进上下文,几乎没有帮助,甚至拉低成功率;真正有效的「上下文学习」,发生在模型对自身动作历史的在线纠错里。除计分的仿真结果外,报告还用案例演示覆盖了人形机器人高层控制与钢琴演奏。
方法:模型直接接进动作链路,单一随机种子、每任务 50 次
报告先给出一套分类法(RoboProbe):按「动作链路上是什么」把 LLM 驱动的机器人系统分成三级。L1 是学习好的策略,公开榜单上的 VLA(视觉-语言-动作模型)与 WAM 都在这一级;L2 是 LLM 只做指示,动作仍由 VLA 输出;L3 是 LLM 直接行动。这份报告做的是 L3:GPT-6 Astra 的动作链路上没有任何 VLA checkpoint(已训练的策略权重),也没有用于策略推理的 GPU,而是通过一个固定、不可学习的执行外壳(harness,Inspect EEF)调用两个工具:移动末端执行器,或者放弃。
它能看到三路 RGB 相机、14 维本体感受(proprioception)和官方指令,没有公制深度;外壳里没有「宣布成功」的工具,成败由 RoboDojo 的官方奖励判定。本地代码会先对请求的末端目标做边界约束,再转成关节轨迹,以 25 Hz 开环播放给机器人。GPT-5.5 与 DeepSeek-Flash 使用同一套外壳,差异只在模型本身。
协议是单一随机种子(single seed):Astra 与 GPT-5.5 每个任务 50 次,42 × 50 = 2,100 次试验;DeepSeek-Flash 每个任务 10 次,共 420 次,报告注明其每任务样本更小,可比性有限。平均成功率按五个能力维度等权计算:泛化 12 个任务、精度 8 个、长程 8 个、记忆 6 个、开放词汇 8 个;Score 是官方脚本算出的过程奖励均值 × 100。公开 VLA 的数据复制自 2026 年 9 月 10 日的榜单快照,没有重跑。报告页面还提供了完整评测视频()与复现入口()。
主结果:五个维度中记忆得分最高、精度最低,成绩呈双峰分布
按维度拆开,Astra 的 Score 与成功率分别是:记忆 43.04 / 38.67%,开放词汇 34.36 / 31%,泛化 33.36 / 30.5%,长程 21.45 / 8.25%,精度 12.65 / 4%。五个维度里,记忆的 Score 与成功率最高,精度最低。GPT-5.5 与 DeepSeek-Flash 的 Score 分别为 1.13 与 2.99。
把三组 LLM 与公开榜单的 40 个策略合并排序,Astra 的 Score(28.97)位列第一,高于公开榜内最高分 DM0.5 的 24.90。但逐任务看并不全胜:对 DM0.5,Astra 有 15 个任务领先超过 5 分,11 个落后超过 5 分,其余 16 个差距在 5 分以内。
平均值还掩盖了一个双峰分布:在官方 42 任务合并结果里,10 个任务的成功率达到或超过 50%,16 个为 0。例如 press_by_number:Astra 为 70.00 分、70.00% 成功率,GPT-5.5 与 DeepSeek-Flash 都是 0。报告写道,平均值是两个任务群体的混合,而不是一个在每个任务上都能成功两成的策略。
物理常识缺口:接触、公差与避障
报告把缺口称为 Physical Commonsense(物理常识):对接触动力学、力敏感度与碰撞几何的隐性理解。性能明显下降的地方集中在三类任务:接触密集型(插入、带摩擦的堆叠)、高精度(紧公差放置)与避障(在杂乱环境中穿行)。
任务偏好也有分化:几何对齐、编号或代数指令、语言条件下的堆叠与分拣更有利于 Astra;连续接触与多步物理脚本更有利于公开 VLA。报告举出具体对照:push_T 上 Astra 得 60.0 分,公开 VLA(Xiaomi)只有 0.7 分;align_blocks 上 Astra 50.0 分,公开 VLA(DM0.5)为 0。报告把它解读为一条能力阶梯:语义理解与空间理解已经就位,物理常识没有。
真机测试因不安全动作中止
报告没有运行完整的 18 任务真机协议:Astra 在真机试验中反复发出物理上不合理或不安全的动作,部分事故损坏了硬件,测试因此中止。保留下来的是停测前后共 12 个任务、33 次试验,每任务 1~4 次,分布在 ARX X5(9 段)、Piper(21 段)、Piper X(3 段),报告强调这不是官方提交。
这 33 次试验合并后的诊断数字是:只有 1 次完全成功(3.03%),5 次拿到非零过程奖励,过程 Score 6.97。报告把官方 18 任务的完整协议结果列为参照(如 OpenWAM-α 为 37.60 / 24.40%,Pi-05 为 22.90 / 12.80%),并注明与诊断样本不可直接比较。
另一组关节位置(joint-position)笔记在 Franka 与一台双臂 humanoid 上记录到三点一致的观察:任务语义可靠;抓取可供性则不可靠,两台机器都不会做出大角度旋转以获得更好的接触;规划器能说出动态修正(比如水流变细时要加大倾角),但感知、推理与控制的环路来不及执行。humanoid 一侧还记录了一个对比:关节位置的旋转在那里比在 Franka 上学得更快,团队猜测与自我中心(egocentric)数据有关。
in-context learning 的反转:示范拉低成功率,在线自修复很强
报告称,今年常见的做法是把人类示范放进上下文、让模型模仿,即所谓的 one-shot ICL。在 340 个「任务-布局」配对(34 个任务 × 每种 10 个布局)上,对照结果是:zero-shot 基线为 22.9%(78/340),图像加末端执行器示范为 17.9%(61/340),纯文本示范为 12.9%(44/340),两个示范条件都低于基线。在 zero-shot 全部失败(0/10)的任务上,图像示范只在 150 次中救回 2 次,文本示范 0 次。
报告给出的解释是:对这些基础模型来说,基本任务技能已经嵌在权重里,一次来自不同布局的示范既不能教它任务意图(它已经懂),也不能提高精度,反而可能因为它属于分布外轨迹而误导模型。
另一组扰动实验用的是同一套 L3 外壳、8 个布局、每布局 1 次试验,默认 100 次规划调用预算,上下文里只保留两帧图像。结果:无扰动 8/8 成功;上下翻转视觉 8/8;左右镜像 6/8;坐标轴取反 4/8(第一次移动后就推断出了符号);遮住头部相机 6/8;只剩一只腕部相机 3/8(布局 9 用 1.7 倍调用预算成功);每次移动叠加半径均值 10 厘米的位姿扰动 3/8。
报告把这种适应分成两种:一种是无声的内部适应,在新的本体或扰动后的动作空间里第一轮就做对;另一种是可见的自我修复,模型发现动作与结果不符,显式识别差异,并在几轮内调整策略。团队强调,这些都是在 zero-shot 条件下达成的。
钢琴实验:0.902 的《小星星》与 0.599 的夜曲
钢琴实验换了一种问法。不让 Astra 通过 L3 外壳逐次动作,而是直接写控制器:一份 play.py,每 0.05 秒输出 45 维关节目标,驱动两只 Shadow 手在 RoboPianist 的 88 键钢琴上演奏,没有训练,也没有参考解法。报告记录,这里的规划器是推理强度为 high 的 Codex;没有运动原语,每个手指、手腕与滑动目标都是 Astra 写出的代码。作为参照,已发表的双手《小星星》RL 策略在官方 note-onset 指标(音符起音)上是 0.886,团队在给 Astra 评分前用官方参考动作复核为 0.8863。
三次运行的结果:单手《小星星》F1 为 0.907(14 个音符,precision(精确率)1.00 / recall(召回率)0.91,22 次尝试,31 分钟);双手《小星星》F1 为 0.902(34 个音符,0.99 / 0.89,33 次尝试,34 分钟),高于 RL 参照;肖邦夜曲片段 F1 只有 0.599(117 个音符,0.85 / 0.58,150 次尝试),模型在未达到给定 0.9 目标时主动停下,并记录了原因。报告指出失败的是 recall 而不是 precision:控制器能按对,但够不到来不及按的音符。
程序离开原谱后的表现同样被单独测试:同一份乐谱加速 17.6% 损失 0.019 F1;但纯转调很贵:升高 2 个半音与降低 3 个半音,大约要付出 0.22 的 F1 代价,因为新调需要的黑键不在固定按压姿态的覆盖范围内。没见过的乐谱区分了同一个变量:全白键的 C 大调音阶达到 0.903,30 个音全部落在正确的手上;D 大调音阶掉到 0.556,34 个发声音符里 11 个被分错手;C 大调和弦失败方式不同,precision 保持 0.98,但 16 个音里只有 12 个真正发声,缺的是同时按压,而不是音高。报告据此写道:为一份乐谱写的程序能推广到速度,以及它被构建时所针对的键位几何,再往外就不行。
此外,模型还把演奏本身生成为一段固定的关节目标序列:通过反复仿真试验细化轨迹,提交 161 个关键帧、每 50 毫秒一个;开环回放拿到单手《小星星》0.901、双手《小星星》0.920 的 F1。团队同时公布了审计记录:三次运行共 201 条 shell 命令、6 次图像查看、0 次网络调用,未发现违规;他们说明测试宿主机没有可用的系统级沙箱,这一点原样写出,不作额外宣称。
这份报告由 RoboDojo 团队署名,页面日期为 2026 年 9 月 16 日,共 12 位署名作者;BibTeX 注明 Wenbo Zhang、Kaixuan Wang、Yutao Ouyang 为共同第一作者,Wenbo Zhang 为项目负责人,Yue Chen 与 Tianxing Chen 为通讯作者。
截至本文检索时,宣布帖有 106 个赞、14 次转发、8,835 次浏览和 13 条回复。署名作者之一 Wenhao Chai 回复说:「团队为取得这个结果付出了极其艰苦的努力,而它真的让我们感到意外。」()项目负责人 Wenbo Zhang 说:「和团队一起把它构建出来,过程很有乐趣。」()也有具体追问:评论者 Stone Tao 问,大多数结果是否仍是微调得到的,而 LLM 这一侧是 zero-shot();另一位回复者则反馈报告站点打不开,希望团队确认站点是否正常()。
报告还把结论限定在仿真栈内:两个发现都来自 RoboDojo-Sim 以及同一栈上的扰动实验,可能说明模型在这种设置下的潜力,但不主张同样的能力会出现在其他场景。而完整的 18 任务官方协议,在安全叫停之后没有结果。