AREX Feed Article
RoboCurve 实测 GPT-6 Astra:机械臂成功率 95%,Fable 5.1 仅 40%
UTC 时间 9 月 5 日 02:34(北京时间 10:34),RoboCurve 联合创始人 Jay Chooi 在 X 发布一条附视频的推文,公布他对 OpenAI GPT-6 Astra 的第三方测量:在机械臂「把积木放进碗」任务上,Astra 得分 95%,同一任务上 Claude Fable 5.1 此前的成绩是 40%;Astra 的输出 token 少 6.2 倍、成本低 2.3 倍()。
这组数字来自 RoboCurve 标注日期为 9 月 4 日的完整报告():让 Astra 控制真实机械臂,把红色积木放进碗里,20 次中成功 19 次(95%),对比的 Fable 5.1 为 8 次(40%)。单轮输出 token 约 2,100 对 12,900,估算成本 0.94 美元对 2.12 美元,平均耗时 2.5 分钟对 6.8 分钟。
报告把 120 次试验的逐轮文字记录、视频与回放数据全部公开。
RoboCurve 是 Y Combinator S26 批次的公共福利公司(Public Benefit Corp)。它在 YC 的 Launch 页面自称「测量并报告前沿机器人在真实世界中实际能做到什么」();Chooi 的 X 简介则写着「在 @robocurve 给机器人做基准测试」()。
上图是报告的摘要图:横轴为单轮估算成本(列表价),纵轴为完成率。左侧「积木入碗」任务中,Astra(紫色)完成率约 95%、单轮约 1 美元,Fable 5.1(青色)约 40%、约 2.1 美元,上一代 Fable 5(橙色)约 5%、约 2.7 美元;右侧「拼图入槽」任务中,Astra 与 Fable 5.1 的完成率几乎重合,差距只剩成本。
Fable 5.1 先刷新了 RoboCurve 的纪录
Anthropic 于 9 月 1 日发布 Claude Fable 5.1(与 Claude Mythos 5.1 同模型、不同安全级别),自称「全球最先进的编码与知识工作模型」()。
RoboCurve 两天后发布了对 Fable 5 与 Fable 5.1 的机械臂对比报告():同一批 YAM 机械臂、同一张 0~4 级评分表,「把积木放进碗里」各跑 20 次,Fable 5 成功 1 次(5%),Fable 5.1 成功 8 次(40%),单轮输出 token 从 19,200 降到 12,900。
Chooi 在 9 月 4 日 16:10 UTC 用一条附视频的推文公布这组结果,措辞是「Fable 5.1 控制机械臂比 Fable 5 好 8 倍」()。与此同时,OpenAI 于 9 月 3 日宣布分阶段推出 GPT-6 Astra()。
OpenAI 的发布页面称 Astra 在 computer use(计算机操作)、软件工程、科学等领域达到 SOTA(state of the art,当前最先进水平),并直接附上与 Fable 5.1 的数字基准对比:Terminal-Bench Science 0.1 上 Astra 为 64.6%、Fable 5.1 为 52.6%,估算 API 成本低约 31%()。
两家旗舰在两天内相继发布,官方基准各自表态;RoboCurve 则把 Astra 与 Fable 5.1 放进同一个测试系列直接比较,这份对比距离 OpenAI 宣布推出 Astra 不到两天。
Astra 结果发出约 30 分钟后,同为 YC S26 批次的 olam_labs 联合创始人 shresh 在评论区写道:「不敢相信,10 小时前这项任务的 SOTA 还是 40%」()。他指的是 RoboCurve 自己上一轮的结果:从那条推文到 Astra 的结果,只隔了约 10 个小时。
同一批 YAM 机械臂、同一个测试框架
测试对象是一对 I2RT YAM 双臂,每臂 6 个自由度、配平行夹爪。模型每轮收到三路摄像头画面(顶部、左腕、右腕)加本体状态,输出绝对末端位姿命令(move_to:位置、姿态角与夹爪开合),由机器人端逆运动学转换成关节角。
运行参数包括 agent(智能体)策略、中等思考强度、每轮最多 20 次模型调用、25% 的速度上限,默认安全护栏开启;测试框架是 Inspect Robots 0.58.0。两个任务的指令分别是:「把桌上的红色积木拿起来,放进碗里」「捏住蓝色圆形拼图块中央的旋钮,把它放进板上对应的圆形凹槽」。
每次试验由人类评分员按达到的最高阶段打分:0 为无目的的接近,1 为接触物体,2 为把物体举离桌面,3 为移到投放点上方,4 为放进最终位置。失败的试验也会按同一张表记录走到哪一步。
照片来自 RoboCurve 上一轮 Fable 对比报告页,展示的是同系列测试中的「积木入碗」装置。报告页为每一次试验逐条列出得分、耗时与输出 token 数,并附 transcript(文字记录)、视频和可回放数据。
需要精度的任务上,两家模型都停在 2/20
碗任务之外,RoboCurve 还测了更难的拼图入槽任务,结果出现了分野。Astra 在拼图任务上 20 次只成功 2 次(10%),与 Fable 5.1 完全相同。报告的原话是,Astra「到达凹槽,然后在 Fable 卡住的同一步骤停了下来」。
效率差距倒是保持住了:单轮输出 token 2,700 对 10,500(少约 3.9 倍),估算成本 1.36 美元对 2.18 美元(低约 1.6 倍),平均耗时 3.4 分钟对 5.9 分钟。上一代 Fable 5 在拼图任务上 20 次全部失败。
Chooi 在头条结果发出两秒后(02:34:12 UTC)又发了第二条推文,主动贴出更难任务的结果:「在涉及精度的更难任务上,Astra 与 Fable 5.1 成功率相同(2/20),但输出 token 少 3.9 倍、便宜 1.6 倍」()。
完成率上的差距全部来自碗任务:拼图任务要求捏住旋钮、对准凹槽完成最后一步插入,两家模型都卡在收尾;更少的 token 与更低的成本则在两类任务上都成立。
成本怎么算、效率从哪来
成本数字能算得这么细,是因为报告公开了计价口径。三个模型的价格都是列表价(list price)每百万 input token 10 美元、output token 50 美元;token 数统计的是线路层(wire-level)的请求与响应 token,而非计费 token。
报告还专门说明:Anthropic 的请求没有使用 prompt caching(提示词缓存),而 OpenAI 自动缓存了 Astra 约五分之一的输入,这部分没有计入折扣,所以「Astra 的成本若有偏差,也是被高估的」。
评论区追问最多的是效率从哪来。有人问 token 减少是来自更强的推理,还是只是输出更简洁()。duetchat 创始人 David 问 computer use 的能力是否可以直接迁移到机器人控制(),Chooi 的回答是:「我不确定,但 Astra 有很强的视觉和 3D 理解能力,这让它能把机器人控制得很好」()。
报告的测试框架对三个模型一致,但报告没有解释差距的成因,只提供了数据与逐轮记录。
「95% 是头条,2/20 才是真故事」
这条推文在周末持续发酵。截至 9 月 8 日,原推已被浏览约 183 万次,获 5,600 余次点赞、620 余次转发。发布约两个半小时后,简介标注为「Codex & ChatGPT @OpenAI」、拥有 61 万粉丝的 Tibo 回复「很酷的应用」()。
机器人从业者给出另一种读法。自称在造机器人与无人机的工程师 vigram 写道:「95% 的头条很酷,但 2/20 的精度结果可能才是真正的故事。一旦去掉粗粒度的『把末端移过去』类任务,瓶颈就弹回状态估计与控制粒度。感觉 LLM 会先吃掉任务规划层,远早于吃掉真正的伺服控制回路」()。
质疑的一方则指向任务设置本身。赞比亚的科技创业者 Chomba Bupe 引用这条推文说,这恰恰是 Astra 不是 AGI 的例子,他在视觉感知演示里也看到同样的问题,即「用颜色鲜艳、形状简单的物体搭配简单背景,让系统更容易处理」()。
也有独立的后续测试出现。9 月 6 日,用户 k7agar 上传了一段 Astra 操控机械臂「擦桌子」的视频,称这是「一个更持久、更有意图的任务,用来测试它的能力」,Chooi 转发该视频并确认「这就是 GPT-6 Astra」(、)。
Chooi 在另一条推文里说,RoboCurve 接下来几周还会分享更多结果()。
报告自己列出的限制
这份报告把自己的弱点写在了页面上,一共五条:Astra 的试验在 Fable 试验两天后进行,且没有交错排列;拼图对比在同一台 rig(试验台)上完成,碗任务的对比则不在同一台,Fable 的碗任务跑在 rig-3、Astra 跑在 rig-1,因为 rig-3 当时不可用;评分由知道模型身份的操作员人工判定,存在无意识偏差的可能。
另外两条是:成本按列表价计算,Anthropic 侧未使用提示词缓存;物体摆放由人工重置,且所有模型都只跑了中等思考强度。
这些限制决定了这组数字的准确读法:它是 RoboCurve 自己的测量口径,方法、评分与计价规则都写在报告里,逐轮记录全部开放下载。碗任务的对比没有在同一台 rig 上完成,拼图任务两家已经打平。95% 对 40% 能否在交错试验、同台 rig 的条件下重现,是这份报告留下的下一个问题。