AREX Feed Article
Dyna-2 用百万小时人类视频训出首个 robot 跨具身 scaling law
2026 年 8 月 10 日,Dyna Robotics 发布了 ——首个在超过 100 万小时人类自我中心视频上预训练的机器人基础模型。它首次证明了一条跨具身迁移的 scaling law:从 1,000 小时到 1,000,000 小时,跨越四个数量级,纯人类视频预训练对机器人任务表现的提升是单调、可预测的,而且曲线没有任何放缓的迹象。在高精度制造任务上,仅靠预训练规模的扩大,任务成功率从 20% 提升至 80–90%。
这条 scaling law 依靠的不是昂贵的遥操作数据。预训练阶段没有使用哪怕一条机器人遥操作数据,物理直觉全部从人类自我中心视频中习得,然后零样本迁移到机械臂、人形机器人和灵巧手上。
「曲线还没有平」——社区在讨论什么
Dyna Robotics 官方推文发布后获得超过 25 万次查看、1300 次点赞和 437 次转发。几条来自从业者的回应点出了围绕这个工作的核心问题。
创始人 Elvis(@omarsar0,31 万关注者)评价:"非常令人印象深刻的工作。在仔细研究 scaling law 并确保其稳健性方面投入了大量努力。"AI 领域知名信息聚合者 (@rohanpaul_ai,15 万关注者)则更审慎:"我很想知道这在差异极大的机器人形态之间能走多远,但即便就目前陈述的结果而言,它已经改变了我对机器人预训练的思考方式。"
NYU 机器人学博士生 (@thejerrycheng)的回应同时夹杂着兴奋和忧虑:"读到这篇博客既开心又难过——如果 scaling 是机器人的出路,那么学术界将很难竞争。在我看来,机器人学学术界至少落后工业界两年。"科技分析师 (@kimmonismus,13 万关注者)则直接断言:"世界模型就是未来。句号。"
(@ShubhamAg0x)捕捉到了一个更具体的转变:"有趣的地方在于,机器人不需要出现在每一次学习中。如果人类视频就能持续提升机器人表现,数据飞轮将变得容易得多。"
遥操作曾是 scaling 的唯一赌注
在 DYNA-2 之前,机器人基础模型的 scaling 路径几乎全部系于遥操作数据。收集一小时的物理遥操作数据成本高昂、速度缓慢,且无法规模化。整个领域默认:要让机器人学会泛化的操作策略,就必须付出昂贵的人工标注代价。
此前最接近的探索来自 EgoScale——它将基于人类自我中心视频的行动预测 scaling law 测量到了约 2 万小时的规模,但机器人端的结果仍需经过人类-机器人对齐训练才能获得。
近期的机器人基础模型——RT-2、OpenVLA、π0、GR00T N1——在跨具身迁移上也展示了零样本能力,但测量维度是单一数据规模,且预训练中仍混入了机器人形态的数据。
Dyna Robotics 的底气来自三件事。第一,它已构建了一个超过 100 万小时的人类操作视频语料库,绝大多数来自头戴式第一人称录像——做饭、整理、折叠、组装。
第二,2025 年它完成了 1.2 亿美元 A 轮融资,有资本把数据引擎推到百万小时级。第三,它在去年发布的 模型已经在酒店、餐厅和洗衣房等场景中实际部署,团队有从模型到产线的完整经验。
因此,DYNA-2 来自一个已经将 VLA 路线推上生产线的团队。而正是这个团队,现在把赌注押在了世界-动作模型上。
世界建模才是跨具身迁移的发动机
DYNA-2 的核心架构建立在视频扩散 backbone 上,是一个"世界-动作模型"(World-Action Model, WAM):同一生成模型可以联合或分别去噪未来视频和未来动作。它使用 flow matching 训练,视频 token 和动作 token 各自拥有独立的 DiT 层,通过注意力机制互相关注。
在 scaling law 实验中,团队构造了 1,000、10,000、100,000 和 1,000,000 小时的嵌套数据子集,确保更大的预算只增加数据而不替换数据。在人类数据 held-out 验证集上,全部四项指标(MSE、L1、accuracy@0.5、accuracy@0.1)均呈单调幂律改进,R² 值在 0.865 到 0.926 之间。
在机器人端,零样本离线评估的结果更为关键。团队用 39 个机器人任务(来自内部 YAM 双臂基准和外部 xdof ABC 数据集)评估同一组 scale-laddered checkpoint——这些 checkpoint 从未见过任何机器人数据。
全部四项指标随人类数据规模单调改善,R² 在 0.884 到 0.918 之间。从 10k 到 100k 小时之间观察到一个拐点:足够多的覆盖范围,仅靠规模就催生了跨 embodiment 的知识迁移。
团队还设计了一组可控消融实验来回答一个更根本的问题:世界建模到底是不是必需的?在固定动作数据量(5k、50k、100k 小时)的设定下,任何形式的未来预测(joint 或 video co-training)在所有 39 个任务上显著优于纯动作预测。
更重要的是,只有 video co-training 能让模型随数据规模持续改进——纯动作预测出现严重且不可预测的过拟合。团队还发现,视频本身就是一条独立的 scaling 轴:将动作标注数据固定为 50,000 小时,只增加纯视频数据(0 → 1,000 → 10,000 → 50,000 小时),机器人泛化能力单调提升。
真实世界 on-robot 后训练进一步坐实了这条曲线。14 个任务(涵盖精密抓取、软体操作、铰接物体交互、五指灵巧手操作和语言指令跟随)在三类 embodiment 上测试,平均归一化得分随预训练规模单调上升:20% → 28% → 45% → 53%。
最极端的两例:Lockbox Key Turning 在 100k 小时内成功率为 0%,到 100 万小时跃升至 90%;Bottle Cap Untwisting 仅用约 13 分钟遥操作数据后训练,成功率仍从 10% 爬升到 50%。
VLA vs WAM:一场有实弹数据的对决
DYNA-2 附带了一次 WAM 与 VLA 的严格对照实验。早期版 DYNA-2 与 Dyna Robotics 上一代生产模型 DYNA-1(基于 Qwen3-VL-3B 的 VLA)在相同预训练与后训练数据、相同超参数下对比——团队的结论是"对 WAM 不公平",因为整个实验管线都是为 VLA 调优的。
即便如此,在 7 个基准任务的汇总结果中,WAM 的成功率达到 VLA 的 1.55 倍,质量评分达到 1.12 倍。逐个 checkpoint×task 单元格对决,WAM 赢了 65%,VLA 赢了 29%,6% 打平。
另一个硬数字来自零样本客户现场部署:在内部评估中两个模型都接近 100% 合格率,一到真实客户现场,DYNA-1 的客户质量通过率跌到 46%,DYNA-2 保持在 87%——41 个百分点的差距,相同的后训练预算。
在抗干扰能力上差距同样明显。切芹菜任务中,DYNA-1 在光照变化或摄像头遮挡后需要人工干预才能恢复。
DYNA-2 在暗光、迪斯科灯光闪烁、顶部摄像头被遮盖、甚至操作员持续把切好的芹菜扔回砧板的情况下,仍然不中断地完成任务。
百万小时后,曲线仍未平
Dyna Robotics 联合创始人 Jason Ma 在新闻稿中把问题说得很清楚:"多年来,通用机器人一直被数据瓶颈扼住喉咙——手工收集物理遥操作数据根本不可能扩展到通用智能。动作数据稀缺,但视频无处不在。通过构建一个在行动之前想象物理世界如何运动的世界-动作模型,我们让机器人获得了传统视觉-语言模型所缺乏的空间推理和接触物理能力。"
DYNA-2 的技术博客最后一句写道:"一百万小时不是这条 scaling 轴的终点;它只是机器人 scaling 新时代的起点。"幂律曲线在百万小时处仍没有平缓迹象,而人类视频的供给远未枯竭。如果这条 scaling law 继续成立,限制机器人能力的就不再是数据量——而是有没有把 video prediction 作为核心目标来训练的模型架构。