AREX Feed Article
AIBuildAI 用 29 小时自主后训练 NVIDIA Cosmos,机器人视频预测 SSIM 登顶
8 月 4 日, 公布了一项演示:其 AI Agent 在 29 小时内,全自主地将 NVIDIA 开源的 Cosmos 世界模型后训练到机器人操作视频预测任务上,在 RT-1 基准测试的 SSIM 指标上达到 0.845——这是截至 2026 年 8 月所有已发表方法中的最高分。
整个过程从接收任务简述和数据集开始,到交付训练代码、评估脚本和最终模型权重结束。没有人碰过那台 8×A100 GPU 的节点。
开源代码、权重、评测全部放出,社区反应冷淡
AIBuildAI 联合创始人、UC San Diego 副教授 Pengtao Xie 在 和 上同步公布了这一结果。他在帖文中写道:"AI agent 自主完成了完整的模型开发生命周期:理解任务 → 设计方案 → 编写代码 → 训练模型 → 分析结果 → 迭代改进,全程无人干预。"
训练代码托管在 ,模型权重发布在 。整套方案包含训练脚本 train.py、推理脚本 inference.py、官方评测协议生成器 gen_official_short.py,以及五个测试样本的生成视频。
截至发稿,Xie 的推文仅有 1 次点赞、零转发和零回复。LinkedIn 帖文获得 25 次反应,无人评论。
Cosmos 在 RT-1 上先天落后 10 dB,这是一个域适应问题
世界模型回答一个简单问题:给定机器人摄像头当前看到的画面和即将执行的动作序列,预测接下来会看到什么。好的世界模型可以作为策略评估、规划和数据生成的"可学习模拟器"。
RT-1 是这个任务的标准公开基准,由 Google 的 Brohan 等人构建,使用 IRASim(Zhu 等人,ICCV 2025)引入的评估协议。测试集包含 4,799 个短视频片段。对每个片段,模型接收第一帧画面和后续 15 个机器人动作,必须生成接下来的 15 帧。预测结果用 PSNR(像素精度)和 SSIM(结构相似性)与真值对比打分。
AIBuildAI 选择的起点是 Cosmos-Predict2.5-2B,NVIDIA 开源的 20 亿参数视频世界模型的动作条件变体。NVIDIA 在另一个机器人平台和相机设置上对该变体做了后训练,因此在 RT-1 上它的起点远低于已发表的竞争者:基座模型仅取得 17.75 PSNR 和 0.716 SSIM,比已发表领先方法低了约 10 dB。抹平这个差距的本质是域适应:新机器人本体、新动作空间缩放、新场景统计。
Agent 并行跑了四种策略,把弱的砍掉,GPU 给了强的
AIBuildAI 的 Agent 以"小型组织"的方式运作。一个 manager agent 读取任务,委托候选方案设计,并行派发编码和训练 worker。每个 worker 拥有自己的代码、checkpoint 和 GPU 份额。每轮结束后,worker 汇报在留出验证集上的分数,manager 决定下一步:继续调参、修改方案,或重新分配算力。
这一次,manager 派发了四种微调策略:
- 全量微调:更新全部 20 亿参数,用 FSDP 跨 GPU 分片。
- 部分解冻:将低秩适配器合并进主干网络后,解冻 attention 和 MLP 层。
- 高秩适配器:冻结主干,训练一个带 rollout 感知噪声条件的大适配器。
- LoRA 延续:一个保守的低秩基线作为安全网。
训练过程中发生了两件体现"管理行为"的事。一个 worker 因上下文溢出崩溃,其工作流在下一轮被重建并完全恢复。部分解冻策略连续两次失败——第一次超出轮次预算,第二次未能汇报结果——manager 直接将它退役,把它的两块 GPU 划给全量微调策略。此后全量微调用六块 GPU 训练,验证 PSNR 从 13.7 连续爬升六轮到 23.4,而轻量级策略在 20 到 21.5 之间停滞。
最值得注意的动作发生在最后,而且完全不涉及训练。Agent 在扫描基准相关文献时,识别出了当前记录背后的技术:FreeAction 的训练时无关噪声截断方法(Kim 等人,CoRL 2025 Workshop)。Agent 从论文中实现了这一技术,在自己的留出验证协议上跑了 A/B 对比,确认了增益,然后才将其纳入最终模型。交付方案是全量微调网络加上这一推理时增强,与当前记录保持者属于同一配方类别,由 Agent 自主发现和验证。
最终,模型在全部 4,799 个测试片段上完成评测:PSNR 25.56,排名已发表方法第四,比最强已发表训练模型 IRASim Frame-Ada(26.05)低 0.49 dB;SSIM 0.845,超过所有已发表方法,包括当前记录配置(0.840)。
这更像一个项目管理 demo,而不是一次模型发布
AIBuildAI 是一家 2026 年 4 月完成 400 万美元 pre-seed 轮融资的初创公司,投资方包括 Sixty Degree Capital 和 ML Capital。其核心产品是自动构建 AI 模型的 AI Agent,此前已在 OpenAI MLE-Bench 上排名第一,并在国际人工智能奥林匹克(IOAI)中以 568.49/600 分超过人类冠军。
这次机器人世界模型的演示延续了同一逻辑,但把战场从数据科学竞赛和学术基准搬到了具身智能领域——一个算力密集、迭代驱动、需要工程判断的领域。
此前,世界模型的开发和适配由人类研究员主导:设计训练策略、分配算力、处理失败、阅读论文寻找改进方案。AIBuildAI 这次的演示并没有创造出比人类更好的模型——PSNR 仍排在第四——但它完成了一个完整研发项目的管理闭环:多策略并行探索、算力动态再分配、故障恢复、文献驱动改进。每一步都记录在案,可审计。
世界模型正在成为机器人学习的底层基础设施。把它们适配到新平台、新本体上的工作,恰好是自主 ML Agent 所擅长的:定义清晰、算力需求大、需要大量迭代和策略判断。AIBuildAI 的这次 29 小时运行表明,这条路的最前沿已经不再超出自动化的射程。