AREXOpen in interactive Feed

AREX Feed Article

X Square 放出 HOST:29 秒视频、62% 成功率、零微调

August 11, 2026

北京具身智能公司 X Square Robot 于 8 月 3 日(Human-to-robot One-Shot Skill Acquisition)框架:人形机器人仅观看一段平均 29 秒的人类示范视频,即可在首次尝试中复现任务,成功率 62%。而当前行业主流的监督微调路线,需要约 50 次专家遥操作示教加上 4 小时离线微调,才能在同一基准上达到约 38% 的成功率。

HOST 将技能获取从"训练时循环"翻转为"推理时学习"。机器人不再需要针对每个新任务采集示教数据并重新训练模型参数,而是把人类视频当作 prompt,推理时一次性消费,策略权重全程冻结。

Chris Paxton 的评价只有六个单词

HOST 开源后在机器人社区引发的讨论不算爆炸,但几个关键节点人物注意到了它。Agility Robotics 现任 AI 负责人 Chris Paxton 在 X 上转发时只写了六个单词:。Paxton 此前在 Meta 和 NVIDIA 从事具身 AI 研究,在机器人社区有超过 3.5 万关注者,他的转发为 HOST 带来了可观的二次传播。

机器人资讯账号 RoboHub(2 万关注者)发了一条更细致的解读线程,点出了框架的核心逻辑:。该线程将 HOST 定性为"人类视频正在变成 prompt,机器人用自己的身体去执行"。

专注 AI 与机器人 GTM 的工程师 Emerson S 则指出了方向上的意义:。

论文于 2026 年 7 月下旬首发于 arXiv,开源公告发布于 8 月 3 日,到 Pandaily 跟进报道的 8 月 10 日正好一周。

八轮融资、三条开源线之后,X Square 放出了第四条

X Square Robot 并非突然冒出来的玩家。公司成立于 2023 年底,到 2026 年 6 月完成 后估值超过 200 亿元人民币(约 28 亿美元),投资方包括 IDG Capital、红杉中国、小米、美团、阿里巴巴和字节跳动。CEO 王谦在公司公告中称,。

HOST 是 X Square 第四条开源产品线。在此之前,公司已陆续放出了端到端具身基础模型 WALL-OSS-0.5(2026 年 5 月)、事件驱动的世界模型 WALL-WM(2026 年 5 月底),以及无机器人数据采集框架 XRZero-G0(2026 年 6 月)。四条线形成了一条清晰的技术栈:数据采集 → 世界建模 → 动作策略 → 技能获取。HOST 填上了最末端的一环。

XRZero-G0 已经尝试用"无机器人"方式降低数据成本:人来戴 VR 手套操作,不占用实体机器人,但采集后的数据仍需离线训练。HOST 更进一步,把训练这一步也省掉了。

论文合作方包括北京理工大学和清华大学的研究者。框架代码已在 开源,配套论文发布于 ,模型权重托管在 Hugging Face。

不看关节,看结果:HOST 如何把视频变成 prompt

传统的一次性视觉模仿方法试图建立从人类视频到机器人关节动作的直接映射。这面临两个结构性错配:人类和机器人的动作速度不同(时序错位),以及两者在形态、视角和外观上的巨大差异(状态错位)。

HOST 的解法是两道工序。第一道叫"目标耦合":用一个 Qwen3-VL-Embedding-8B 对齐模型,将机器人轨迹和人类视频映射到同一个"任务进度流形"上,用 Smooth DTW 算法计算对应关系。每个预测目标不再锚定固定的时间偏移,而是跟随视频中任务的进展。

第二道叫"自锚定预测":一个双专家自回归扩散模型依次完成三步:先定位机器人在视频中的当前进度,再将接下来的视频进展转化为机器人自身视角的未来观测,最后从这些预测观测中推导出动作序列。视频专家从 Wan2.2-TI2V-5B 初始化,动作专家通过共享注意力与之通信。

训练分两阶段。第一阶段在 193,462 条机器人轨迹(覆盖 229 个任务)上学习同形态配对,培养"跟随另一条执行轨迹"的能力。第二阶段用 5,847 组人-机器人配对数据做适配。最终推理时,策略权重完全冻结。

在 50 个全新操作任务的测试中,HOST 在用于基线对比的 8 个任务上平均成功率 62%,比最强的不更新参数基线(AWDA,19%)高出 43 个百分点。而最强的监督微调基线(Wall-OSS + SFT)用 50 次示教达到约 42%,HOST 用 1 段视频超过了它。

更关键的是技能保留率。SFT 路线每学一个新任务,共享的模型参数就会被覆盖,旧技能随之衰退:最强的 SFT 基线在连续学习后保留率仅 43%。HOST 的技能存在外部视频中,策略权重不变,保留率 99%。

当一段 29 秒视频能顶 50 次人工示教

具身智能行业目前的数据采集范式以遥操作为主。工程师戴上 VR 头显,逐帧操控机器人手臂完成任务,重复数十遍,再让模型做离线微调。一台数据采集机器人售价数十万美元,单次示教的边际成本超过一百美元。这也是为什么印度出现了"数据工厂",中国县城有兼职工人在做动作数据采集。但成本仍然不随规模下降。

HOST 攻击的就是这个瓶颈。如果一段手机拍摄的 29 秒视频能替代 50 次遥操作示教和 4 小时 GPU 微调,那么数据采集的经济模型就彻底变了。指出,该框架将具身智能训练范式从离线微调翻转为推理时 in-context 模仿学习,直接压低了数据采集成本。

但 62% 目前仍是研究基准,不是部署级指标。论文自己也测试了鲁棒性:在光照变化、陌生物体、场景替换和人类干扰四种扰动下,成功率分别下降 1 到 9 个百分点不等。

X Square 知道这一点。公司同时在推进与 58 同城合作的入户清洁服务,以及"X 家庭成员计划":让机器人在用户家中居住长达一个月。这些部署产生的真实交互数据,将决定 HOST 这类推理时学习框架在实际场景中能走多远。

62% 不是终点,但训练范式已经转向

HOST 最重要的信号不是某一个 benchmark 数字。它证明了另一条技术路线是走得通的:不靠堆数据、不靠反复微调,让机器人看着视频当场学会一项新技能。当数据采集从"训练前提"变成"推理输入",具身智能的成本结构就与过去几年的大模型训练史拉开了距离。

参考链接

  • (2026-08-03)
  • (2026-08-10)
  • (2026-06-29)
  • (2026-06-30)
  • (2026-08-03)
  • (2026-08-03)
  • (2026-08-03)