AREX Feed Article
"你微调不出 AGI":1X 成立 World Model Lab,把赌注押在世界模型上
过去两年,人形机器人公司的主流做法出奇地一致:拿一个大语言模型或视觉语言模型(VLA),在上面接一个动作输出头,再用机器人数据微调。这套配方看起来省事,前提是基础模型已经理解了世界,你只需要教它怎么动。
1X 的 CEO Bernt Børnich 认为这条路走不通。
2026 年 6 月 4 日,这家挪威裔美国公司宣布成立 ,一个专门做大尺度具身世界模型预训练的前沿研究组织。Børnich 在同日发布的 中把话说得很直:"You can't fine-tune your way to AGI. And you definitely can't fine-tune your way to robots that can operate in the physical world." 同日 刊登了 John Koetsier 对他的专访,Børnich 在采访中重申了同一判断。
一份没人想第一个签名的赌约
1X 的赌注拆开来看其实只有两句话:具身智能的基础模型必须从预训练第一天起就"看见"物理世界,而不能把机器人数据当成后装的微调补丁。
这个判断直接挑战了整个行业的工程惯性。机器人创业者 Joe Harris 在分析 Børnich 的宣布时 ,VLA 当初之所以流行,是因为机器人数据稀缺,"把动作输出头焊在视觉语言模型上"是绕过数据瓶颈的权宜之计。但现在机器人数据正在追上:"there's no problem to work around anymore"。
世界模型和 VLA 到底差在哪?VLA 的做法是:看一张图 → 输出一个动作。世界模型的做法是:看当前状态 → 在内部推演接下来会发生什么 → 再决定动作。后者必须在见到任何具体任务之前就理解空间、运动、物体、因果关系、可供性(affordance)和基础物理。Børnich 在推文中的原话是:"General-purpose humanoids need models that understand space, motion, objects, causality, affordances, physics, and action before they ever see a specific task."
Sam Sinha,1X 新任 Founding AI Researcher 兼世界模型负责人,此前是视频生成公司 Luma AI 的创始研究科学家。他在 中把问题讲得更尖锐:"Embodied data has been treated as a second-class citizen for too long. Embodied AI is too important to be a fine-tuning problem."翻译过来:具身数据被当成二等公民太久了;具身智能太重要了,不能只是个微调问题。
五层数据、一个飞轮
1X 画出来的数据配方由五层构成:
互联网规模媒体(web-scale media)+ 第一人称人类视频(egocentric human videos)+ 仿真 + 远程操作机器人数据 + NEO 自产数据(on-policy NEO data)→ 真实世界部署收集更多数据 → 强化学习 → 数据丰裕 → 物理 AI
这个链条的最后一环是关键:NEO 机器人自己就是数据采集节点。Børnich 在推文中用三行短句把这个循环写了出来:"The robot collects data. The model gets better. The robot gets better. Repeat."
每种数据在这个配方里承担不同角色。互联网媒体提供关于物体、场景和人类行为的广泛知识。第一人称人类视频(人从自身视角录下的日常动作)教模型理解人如何在物理空间中移动和操作物体。仿真环境提供可大规模并行、可无限重复的试错空间。远程操作数据则把人的操作技巧翻译成机器人可执行的轨迹。最后,NEO 在真实世界中自主运行产生的 on-policy 数据,是整个飞轮中最珍贵的燃料:它是模型自己决策后果的直接反馈。
为什么非要做成人形?一个常被忽略的设计动机在于数据兼容性。人形机器人越接近人体结构,就越能直接利用互联网上已有的巨量人类视频作为预训练数据。日本 VC 田中洸輝在 里把这个逻辑讲得很清楚:"人間に近い身体を作るほど、インターネット上の膨大な人間の動画データを、ロボットの学習にそのまま利用できる"——身体越接近人,就越能直接用人类视频训练。
1X 官方博客透露,这次成立 World Model Lab 的时机并非偶然。在此之前,1X 内部的世界模型已经在 NEO 上跑通了"zero-shot 泛化":机器人面对从未见过的任务,不需要额外训练就能执行。CEO 在博文中写道:"These advances enabled NEO to generalize to completely unseen tasks with zero-shot execution. For us, this was when the recipe for fully autonomous humanoids clicked."
这种 zero-shot 泛化能力是区分世界模型路线和 VLA 路线的一个关键指标:VLA 通常需要对每个新任务收集示范数据并微调,而一个真正理解物理世界的模型,看一眼就应该知道怎么做。
造机器人的机器
1X 敢把全部筹码推上桌,底气来自一条几乎与其他机器人公司完全不同的路径:它自己造硬件。
2026 年 4 月 30 日,1X 其位于加州 Hayward 的 NEO 工厂全面投产。这座 58,000 平方英尺的工厂采用真正的垂直整合模式:电机、电池、传动系统、肌腱、传感器、连软性覆盖材料都在厂内自造。从铜线圈绕制到电机装配,产线自动化设备全部由 1X 工程师自行设计和搭建。目前工厂已有 200 多名员工,具备年产 10,000 台 NEO 的能力,并计划在 2027 年底前通过进一步自动化将产能推至 10 万台以上。
同一篇博客披露:NEO 预购开启后 5 天内,1X 就售罄了第一年的全部产能。根据 1X ,每台 NEO 售价 20,000 美元,或月付 499 美元。这意味着一旦交付启动,数千台 NEO 将同时涌入真实家庭环境,每一台都是一座流动的数据矿井:这就是 World Model Lab 的数据飞轮底座。
Sam Sinha 与 Luma AI 的基因
Sam Sinha 的履历和这间实验室的路线图高度咬合。作为 Luma AI 的创始研究科学家,他全程参与了大尺度多模态视频生成模型的 scaling 工作,包括 Uni-1 项目。Luma AI 的核心能力是视频生成:让模型理解和预测像素如何随时间变化。世界模型需要的恰恰是这个能力,只不过预测对象从像素层面的变化扩展到了包括空间、力学和交互后果的完整物理状态。
Georgia Tech 机器人学教授 Animesh Garg 在 Børnich 的推文下留言:"great hire in @sam_sinha - I can attest to that"。
1X 在官方博文中明确表示正在 World Model Lab 的三个方向(数据、基础设施、学习)大规模招聘,投递渠道是 。
VLA 的退场?
Børnich 的推文下有一条来自 的回复:"can we finally forget about VLAs?"他回了一个词:"yes。"
Joe Harris 把 VLA 和世界模型做了更细致的拆解:VLA 的问题不在于它不能工作,而在于它设了一个天花板。"fine-tuning off the shelf is fast but it's a ceiling. the teams training from scratch on their own data are compounding. that gap only grows."
,一位 AI 和机器人领域的从业者,也在推文中点出了一个常被忽视的事实:1X 的飞轮不是"有朝一日"的事情。"with their NEO factory already live and robots out there collecting real data, the flywheel isn't a someday thing anymore. It's running."
当然,并非所有人都买账。 在 CEO 推文下反驳:"World models won't work well. They will work, but not well。"这种质疑指向了世界模型方法最大的未知数:从视频中学习物理直觉这条路,到底能走多远?
一座工厂、一万个数据节点
1X 的 World Model Lab 成立不是一次普通的团队扩建。它是一次公开的方法论站队:在整个人形机器人行业还在享受 VLA 带来的"先跑起来再说"红利时,1X 选择退回一步,从预训练阶段开始重建机器人的世界理解。
两个月后, 在一篇推文中将 1X 的选择总结为"the right bet":你的机器人不需要更好的策略网络,它需要的是一个更好的物理世界内部模型。"The companies building world models for embodied AI will leapfrog everyone still brute-forcing sim-to-real with more data。"
赌注之所以成立,是因为 1X 手里握着其他纯 AI 公司没有的牌:一座已经投产的垂直整合工厂,和即将进入数千个家庭的 NEO 机器人。世界模型路线如果被证明是对的,1X 已经建好了别人最难以复制的环节——不是模型架构,不是训练技巧,而是由真实机器人构成的数据飞轮。
到 2026 年底,当第一批 NEO 进入消费者家中时,这个赌注将拿到第一份真实的成绩单。