AREX Feed Article
Skild AI 发布机器人基础模型 S1:单个视频提示,实时学会最长 10 分钟未见任务
8 月 25 日,Skild AI 在官方 X 账号宣布推出机器人基础模型 S1,并同步上线技术博客《Introducing S1: In-Context Learning for Robotics》。称,S1 只需一个视频演示作为提示,就能实时学会预训练中从未见过的任务,最长可达 10 分钟,全程无需微调。
公司给出的最具体证据是一条时间线:在记录的植物换盆实验中,从演示到 S1 在真机上自主执行,博客给出的时间是 11 分钟;在未见任务上,S1 相对语言提示的策略获得约 7 倍的成功率提升(66% 对 9%)。这些数字均为公司自报,博客没有附论文、模型权重或第三方评测链接。
一个视频提示,替代了语言指令
推文原文写道:"Introducing S1, our new foundation model that learns from one example. It can be taught 10-minute long tasks that it has never seen before, from one video prompt without any fine-tuning."(介绍 S1,我们的新基础模型,它从一个例子中学习。一条视频提示就能教会它从未见过的、长达 10 分钟的任务,无需任何微调。)推文附带的视频展示 S1 通过上下文学习实时运行;截至 8 月 26 日,该推文显示约 160 万次观看、3,600 余次点赞和 350 条引用。
博客把 S1 的核心设定写得很直接:任务由视频演示指定,而不是语言。它展示了四个 S1 从未训练过的任务:植物换盆、煎饼翻面、手冲咖啡和套件组装。每个任务最长运行 10 分钟、包含几十个操作步骤,全程只由一个视觉演示驱动。
博客称,S1 在其中展现了全新的测试时行为:挖开土壤给植物腾出位置、把咖啡滤纸压进滤斗、把煎饼翻面。用博客的话说,它把演示当作目标规范,而不是照抄的轨迹。
演示进入上下文,权重一动不动
S1 的学习方式与微调无关。预训练阶段,模型看到的每段数据都只通过一个上下文演示来指定任务;演示可能来自不同的场景、视角甚至不同的机器人本体,策略必须自己推断演示者的意图、物体间的功能对应关系和任务进度。
推理阶段,演示视频直接进入上下文窗口,策略把它翻译成自己本体和当前场景下的动作。用博客的元学习表述:预训练是外循环,教策略学会如何从上下文学习;推理时演示驱动内循环,任何权重都不改变。博客强调,文中所有示例由同一套权重产出,没有微调、没有后训练。
训练与数据侧的信息:S1 基于 NVIDIA AI 基础设施训练;数据来自遥操作、UMI、第一人称视频和仿真四条线,这四类数据在硬件接近度、多样性和可扩展性上各有取舍,Skild 全部自建,并称每花 1 美元采集数据,就花 3 美元做质量控制。
博客还列举了它观察到的涌现行为:任务中途把物体滑走、调换物体、改变光照,S1 照常完成;失败后会重试;演示用浇水壶浇花而现场只有杯子时,S1 用杯子代替;演示者打翻鸡蛋留下烂摊子,S1 用受控动作完成同一步骤。
11 分钟学会换盆,7 倍提升从哪来
植物换盆是博客唯一给出完整时间线的任务。晚上 8 点 54 分,土壤、花盆、浇水壶和植物送到办公室;9 点 16 分布置好场景、开始录制演示;9 点 22 分录完一段第一人称人类演示;9 点 27 分,S1 开始在真机上自主执行。博客给出的口径是:从演示到自主执行共 11 分钟,其中大部分时间花在搬家具和布置场景上。
7 倍数字来自一项受控对比。Skild 在预训练数据的一个过滤子集上分别训练了 ICL 策略和语言提示的 VLA 策略,数据规模从 1,000 小时到 10 万小时,除提示嵌入外架构相同、算力相同。指标是全部任务的平均每步成功率;为了给每一步打分,评测中用人工干预让策略从失败中恢复。
结果分两种情形。已见任务上,1,000 小时数据时语言条件策略以 53% 对 43% 领先,但数据规模扩大后 ICL 反超。博客把原因归于语言本身有歧义,而演示指定的是唯一模式。未见任务上差距拉大:10 万小时数据时,语言提示策略的成功率只有 9%,ICL 是 66%,即约 7 倍。博客给出的解释是两点:新技能(如翻煎饼)缺少语言可依托的动作接地,新任务组合也很难用一句语言指令说清。
另两个数字同样来自自报:一次上下文演示约等于 380 个后训练样本(按插值估计);用 2,000 个演示微调后的策略达到 86%,反超 S1 的 66%。Skild 称随着 ICL 预训练规模扩大,这个差距会缩小。在分布偏移测试中,让一半动作改由另一只手臂执行(L5 级别),语言提示 VLA 的退化幅度是 ICL 策略的至多 3 倍。
机器人还困在「BERT 时代」
博客的叙事起点是把机器人学习比作语言模型的 BERT 时代:每个新任务都要重新采集数小时数据、微调一个专用策略。它引用 FACTR 2 研究的结论反问:后训练数据足够大、覆盖足够密时,从零训练的策略也能追平微调后的基础模型,那预训练还有什么意义?
Skild 的答案是把预训练的意义定义为上下文学习本身。过去一年它沿着这条线推进:2025 年 9 月发布运动控制领域的上下文学习模型 LocoFormer,它靠把实时经验累积进提示来适应;2026 年 2 月首次在分布内操作任务上看到 ICL 迹象;2026 年 5 月 S1 翻出第一张煎饼;2026 年 8 月正式发布 S1。
博客援引 Jim Fan 的话为这套框架背书:"Once you have enough data, many behaviors can actually be zero-shot... Whether in-context learning truly works or not also depends on how far away the test is from training."(数据足够多时,许多行为其实可以零样本完成……上下文学习是否真的有效,也取决于测试离训练分布有多远。)因此它用两条轴评估 ICL:任务是否在预训练分布内,任务时程是短是长。
按 Skild 的判断,同期工作(Jiang 等人的 RoboTTT 和 Generalist AI 的报告)大多只覆盖短时程或分布内任务,而 S1 是首个在最长 10 分钟、预训练中从未见过的任务上展示上下文学习的机器人基础模型。这一判断出自公司自述,博客未附可独立核验的评测材料。
自报的数字,和还没公开的东西
S1 目前对外展示的公开材料包括公告推文、一篇博客和演示视频。博客没有附论文、权重或第三方评测链接,所有成功率都来自内部基准;页面元数据中的时间戳为 8 月 18 日,公开发布节点则是 8 月 25 日的官方 X 公告。
博客自己也承认了边界:微调策略在 2,000 个演示后仍能以 86% 超过 S1 的 66%,差距能否缩小取决于 ICL 预训练是否继续扩大。博客提到的落地进展是:S1 已经在商业伙伴处工作,新任务的快速部署会把真实交互经验喂回预训练。
这篇博客被定位为系列文章的第一篇,S1 的训练方法细节留待后续发布。在那之前,「11 分钟学会换盆」和「7 倍于语言提示」都只是 Skild 自己报告的数字。