AREX Feed Article
穹彻智能联手阿里云建具身数据产线,全程无人干预,吞吐提升10倍
具身智能公司穹彻智能(Noematrix)联合阿里云构建了一套端到端自动化 UMI 数据处理产线。据穹彻智能在8月10日发布的中披露,这条产线覆盖手持夹爪数据采集、SLAM 位姿重建、鱼眼去畸变、VLM 自动动作分割与语义标注、LeRobot 标准数据集导出全流程,将原本依赖人工和单机跑批的流程变成了一条云上自动化生产线。
穹彻智能称,产线落地后数据处理吞吐提升超过10倍,全程无需人工干预,云端弹性算力可扩展至10万+ CU,模型训练效率提升约50%。
采集只是开始,处理才是噩梦
要让机器人学会抓取、翻转、开门这些操作,最直接的路径是模仿学习:给人一个手持设备,记录下人的动作,再让模型去学。UMI(Universal Manipulation Interface,通用操作接口)方案正是为此而生。一只搭载鱼眼相机的手持夹爪,在人手自然操作中同步记录第一视角画面、末端6DoF位姿轨迹和夹爪开合状态。
但采集只是第一步。据穹彻智能描述,原始数据要变成模型可用的训练集,中间横着四道坎。
第一道是位姿恢复。手持采集没有外部动捕设备,需要从鱼眼视频中用视觉 SLAM 算法重建夹爪的6DoF位姿轨迹。视频越多,算力需求成倍膨胀。
第二道是相机标定。手持夹爪用的大广角鱼眼镜头画面严重畸变,需要逐帧去畸变并估计焦距与内外参,同样是重度计算任务。
第三道是动作分割与语义标注。连续操作中,一个原子动作何时结束、下一个何时开始,人工界定成本极高。每个片段还要配上自然语言指令,靠人工标注无法规模化。
第四道是数据量。数百小时视频叠加多重处理,单机算力无法承载。链路长、任务耗时久,任何一个环节中断都可能让整批处理前功尽弃。
MaxFrame重构数据链路,VLM接管语义标注
穹彻智能与阿里云合作搭建的产线,核心思路是用云原生的分布式计算和 AI 能力替代人工和单机瓶颈。
在计算层,阿里云 MaxCompute MaxFrame 作为分布式 AI 计算引擎承担主力。数百小时视频的多重处理任务被拆分到分布式资源:GPU 负责 SLAM 位姿重建和 VLM 多模态推理,CPU 负责去畸变、切分、时间对齐、质检和动作计算。SLAM、鱼眼去畸变等第三方模型以 DataFrame 算子形式分布式运行,据穹彻智能称无需为上云重写算法。
语义标注环节使用了阿里云原生 AI Function,直接在数据处理链路中调用通义千问 VLM(QwenVL)为动作片段生成语言指令。穹彻智能表示,这使多模态标注实现了大规模自动打标,无需自建推理服务。
在调度层,DataWorks 提供企业级调度能力:支持分/时/日/周/月/年精细周期调度,一键补数据支持历史回溯与重算,异常自动重试与基线延迟预警保证数据按时产出。每个处理阶段独立落表,支持断点续跑;单个视频片段失败只记录、不阻塞全局。
产出数据进入 Hologres 实时数仓管理 episode 元数据,为样本检索、标注审核和训练数据管理提供统一在线入口。随后进入 PAI 平台:PAI-DSW 完成调试与小规模验证,PAI-DLC 开展多卡分布式训练,PAI-EAS 负责部署评测。
最终输出符合 LeRobot 标准的数据集:data/ 存放逐帧 state 与 action 的 Parquet 文件,videos/ 存放原子动作 MP4,meta/ 以 JSONL 记录语言指令。据穹彻智能称,该数据集可被 LeRobotDataset 直接加载,对接 pi0、GR00T、OpenVLA 等主流 VLA 模型,也可用于穹彻自研的 LingBot-VLA 训练链路。
针对 LingBot-VLA 的训练性能,PAI-TurboX 结合实际计算图做了专项优化:评估 FlashAttention 和 FlexAttention 路径,启用自动调优按输入形状选择更优 Kernel,分析动态 Attention Mask 的重复编译影响。穹彻智能称,优化后模型训练效率提升约50%。
穹彻是谁,为什么押注数据基础设施
穹彻智能成立于2023年11月,由通用智能机器人公司非夕科技(Flexiv)战略孵化。联合创始人卢策吾是上海交通大学教授,曾在斯坦福人工智能实验室师从李飞飞和 Leo Guibas,据穹彻智能称其为"国内最早研究具身智能领域的学者之一"。另一位联合创始人王世全于2016年发起创立非夕科技。
穹彻智能此前已完成多轮融资。2025年10月,穹彻智能,多位老股东追投。2026年2月,穹彻智能完成数亿元 A 轮融资,由 C资本领投,Sea Limited、普华资本等跟投,老股东 Prosperity7 Ventures 超额追投。2026年6月,穹彻智能完成新一轮数亿元融资,投资方包括上海交通大学 AI 未来基金、无锡数据集团等。
在产品层面,穹彻智能围绕"数据—训练—部署"全链路布局,核心产品包括具身大脑 Noematrix Brain、具身工具链 Noematrix Toolchain 和原子技能库 AnySkill。UMI 数据处理产线是其数据基础设施的关键一环。
当模型不再是唯一瓶颈,数据产线就是下一个战场
具身智能行业正在经历一个转折。2025年前后,行业注意力集中在模型能力:谁家的 VLA 模型更强、泛化更好、任务成功率更高。但进入2026年,穹彻智能与阿里云在中抛出一个判断:真正限制机器人进化速度的,正在从模型转向数据。
大语言模型可以利用互联网上海量文本,但机器人操作数据必须从物理世界中采集。每一次抓取、搬运、整理,都需要真实发生并同步记录视觉、动作、轨迹等多模态信息。采集难、处理难、标注难、规模化难,四个难题叠加,让数据成为比模型更紧迫的瓶颈。
穹彻智能与阿里云的这次合作,试图验证机器人数据能否像互联网数据一样,建立起规模化、自动化的生产体系。从穹彻智能公布的指标看,吞吐提升10倍以上,10万+ CU弹性算力,全程无人干预——至少在这条产线内部,自动化已经跑通。但这些数字目前仅来自企业自述。
UMI 方案本身来自,发表于 RSS 2024 并获 Best Systems Paper Award Finalist,其核心思想是用低成本手持设备替代昂贵机器人平台进行数据采集。穹彻智能在此基础上将后处理流程工业化,补齐了从原始采集到标准数据集之间的工程缺口。
一条产线的边界
穹彻智能建成的这条产线,验证了具身智能的"数据—模型"全链路可以自动化跑在云上。它把数据处理从手工作坊变成了流水线,但流水线的上游,物理世界中的数据采集,仍然是瓶颈。UMI 手持设备降低了采集门槛,但一个人一次只能演示一个动作,规模化的数据采集本身仍然没有"自动驾驶"。
穹彻智能在宣传资讯中表示,未来将继续与阿里云在"世界模型等前沿场景"深化联合创新。从这次合作来看,具身智能的数据基础设施正在从各家自建的手工作坊,走向可以复用的云上产线。但这条产线的上游,物理世界中的数据采集,距离工业化还有更长的路要走。