AREX Feed Article
World Labs 发布下一代世界模型 Atlas:1~6 张图生成 1 分钟 1440p 视频
9 月 1 日,World Labs 在官方博客发布下一代世界模型 。官方称,这是一个从零预训练的 omni 模型,原生处理文本、图像、视频与 3D;架构上为多模态自回归扩散 Transformer,所有输入统一到共享的 3D「空间上下文」,再逐个生成与已见内容保持 3D 一致的下文。
最可量化的能力是:输入 1~6 张参考图,按手动设计的相机路径生成最长 1 分钟、1440p 的视频;输入 1 张到百余张图像,把真实场景重建为点云与 3D Gaussian splat(3D 高斯泼溅)形式的显式 3D 输出。以上均为 World Labs 官方口径,截至发稿未经独立验证。
李飞飞:这是迄今最好的相机可控世界模型
截至发稿,官宣推文已有约 12.8 万次观看、1,136 次点赞。称 Atlas 是「世界上第一个既能以像素级相机控制生成图像与视频帧、又能将其重建为 3D 的多模态世界模型」,并配上一句口号:「建模世界,移动相机,模拟空间与时间。」
截至发稿能看到的公开评价,主要来自 World Labs 创始团队,以及 a16z 的 Martin Casado。(World Labs 联合创始人兼 CEO,斯坦福大学教授)写道:「这是迄今最好的相机可控世界模型,为从 VFX(视觉特效)到机器人的许多用例打开了大门。」
联合创始人 说,Atlas 的特殊之处在于,「把生成与重建这两个我研究了十多年的核心视觉智能任务,结合在了一个模型里」。在 World Labs 负责 3D 工作的 (NeRF 的共同创造者)补充说,Atlas「同时是相机可控视频生成、新视角合成与稀疏 3D 重建的一流方法」。
(a16z)的评价是:「了不起的成就。把它想成一个完全相机可控的视频模型,场景保持(近乎)3D 一致;它构建在完全自研的基础模型之上,用例从视频编辑、3D 重建到机器人都有。」
从 Marble 到 SceniX:生成、重建与模拟汇入一个模型
Atlas 是 World Labs 产品线的一次换代。第一款产品 于 2025 年 11 月 12 日向所有人开放,能从文本、图像、视频或粗略 3D 布局生成可进入、可编辑的 3D 世界,导出为 Gaussian splat、网格或视频。
2026 年 1 月 21 日,World Labs 推出 ,把 Marble 的世界生成变成可编程接口,用于游戏、建筑可视化,以及与 NVIDIA Isaac Sim、MuJoCo、RoboSuite 对接的机器人模拟。
机器人这条线在 7 月明显加速。7 月 21 日,World Labs 宣布机器人公司 ;7 月 28 日公布的 称,完全在模拟中训练的策略零真实数据迁移到 ALOHA、RB-Y1、YAM 等真实机器人上,其中多个演示任务连续自主运行一小时无需干预。
Atlas 把生成、重建与模拟收进一个模型:相机可控图像/视频、真实场景转显式 3D、多相机视频重取景与 Real-to-Sim(真实到模拟)机器人工作流。官方说明,Atlas 输出的 3D Gaussian splat 与 Marble 使用同一种表示,能「自然地与其余产品整合」,并将「驱动未来版本的 Marble 及其他产品」。
空间上下文:把每一张图钉在 3D 坐标里
Atlas 的架构由四个特性拼成:多模态、自回归、扩散、Transformer。它当前原生处理文本、图像、相机位姿和 3D 深度图,视频被表示为图像序列;扩散部分采用 rectified flow(整流流),通过逐步去噪生成输出。
每一张图像和深度图都附带显式相机位姿,相机几何因此成为原生输入类型,「像素级相机控制」由此而来:用户直接指定机位与轨迹,而不是用文字描述镜头。官方还称,它可以受益于 LLM 推理侧的 KV 缓存(KV-caching)、缓存感知路由(cache-aware routing)、分离式推理(disaggregated serving),以及图像视频模型侧的扩散蒸馏(diffusion distillation)、无分类器引导(classifier-free guidance)等工程进展。
官方称它像 LLM 一样先编码上下文再生成输出,区别在于「每张图都被锚定在 3D 空间中的一个位置,形成空间上下文」。
一个演示把两张互不相关的参考图放进上下文并摆好位置,Atlas 生成一个在两者间平滑过渡的世界,想象出门洞、走廊等过渡结构。示例视频中,少量参考图加一条手工设计的相机路径,Atlas 就生成了一段连贯的世界。
重建一侧,官方称典型情况下 2~3 张图就能忠实重建,输入越多、想象越少;斯坦福 Main Quad 的例子只用 2~25 张地面照片,就生成了高空俯瞰的航拍路径。
机器人模拟中,每个环境用手机视频的 24 帧完成重建,再从机器人视角生成 RGB 与深度数据,可改变物体、位置、运动、光照与背景,覆盖刚体、铰接体与可变形物体。
时空模拟还有一项「子弹时间」演示:用 3~5 台普通手机(三脚架与背包夹固定)拍摄的素材,即可冻结时间并从任意角度重取景。
反超专业重建模型?先看官方评测口径
World Labs 表示「没有单一基准能覆盖 Atlas 的通用性」,因此只公开了两项任务的量化评测。
相机可控生成方面,它对比一批顶尖视频模型,每轮用 1 张输入图配 1~3 个电影感相机运动(pan、truck、crane 等);竞品不接受原生相机输入,官方用文本描述相机路径,再请第三方人工评审判断谁更贴合目标轨迹。结论是 Atlas 胜出,且轨迹越复杂优势越大。
3D 重建方面,对比对象是「最好的专用开源重建模型」,图表中的基线包括 Pi3X、VGGT-Ω、Depth Anything 3 与 MapAnything;官方称复现了所有基线以保证评测协议一致。图表标题为「3D Reconstruction Error(越低越好)」,但正文没有给出具体误差数值。
另一个主张是规模定律:官方称训练了一系列规模与训练算力递增的模型,每一档算力都解锁了新能力,因此「性能随训练算力增加而提升」预计会持续成立。这些结论全部出自 World Labs 自己的博客。
早期访问开放,公开验证仍是悬念
Atlas 目前只对选定合作伙伴开放早期访问,官网提供申请入口;博客同时发布了研究工程岗位的招聘信息。官方博客没有公布面向公众开放的时间表,也没有说明它会以什么产品形态落地。
在独立复现与 Marble 新版本出现之前,「反超专业模型」的说法只能追溯到 World Labs 自己。