AREX Feed Article
682 集触觉操作数据全开源,Sharpa 为 IROS 折纸赛先交底牌
7 月 30 日,Sharpa 在 X 平台丢出了一份机器人操作领域少有人敢开源的东西:682 个 episode 的双手折纸演示数据,包含多视角视频与十指指尖高分辨率触觉传感信号,面向 全量开放。,覆盖 51 个采集季、476 万帧画面,同步记录了 6 路视频流和 10 个指尖的六轴力/力矩信号。
高分辨率触觉操作数据在公开领域几乎是一片空白。大多数机器人实验室把它视为专有资产,不出门。Sharpa 这次把底牌摊在了比赛开始之前。
「触觉是机器人的边疆」——Chris Paxton 下场定调
数据集发布当天,目前在 Agility Robotics 负责 AI、此前在 Meta AI 和 NVIDIA AI 从事 embodied AI 研究的 连发两条推文。第一条写道:「触觉是机器人的边疆——通往人类级灵巧性的路径,就藏在这样的挑战问题里。」他直指核心问题:「我们能不能训练出触觉感知的机器人基础模型?能不能在这道挑战题上达到人类级灵巧性?」
第二条更直接:「这可能是目前公开可见的机器人灵巧操作中最令人印象深刻的一个案例,你现在就可以下载数据。」
机器人触觉公司 REK 的 CTO 回应 Paxton 称其「一如既往地说到了点子上」,并补充 REK 会以自己的方式推动触觉前进,「但路径会非常不同。」
在社区层面,开发者 评论道:「灵巧操作的开放数据集极其罕见。这对 sim-to-real 研究意义巨大。」用户 则指出:「触觉感知的基础模型才是正确的问题——大多数机器人数据集完全跳过了触觉。」
官方账号回复:「对机器人社区来说是巨大资源。IROS 见。」
为什么偏偏是折纸?纸是操作策略的噩梦材料
折纸看起来简单:一张 15×15 cm 的纸,六次折叠,折成一架传统日本纸飞机(kami hikōki)。但纸这种材料对机器人操作策略而言几乎是故意刁难。
纸在接触下会变形。折叠一旦开始,纸面会自我遮挡,摄像头看不到正在发生的接触。更致命的是,纸对时机错误的惩罚远远超过刚性物体:用力过猛就撕裂,用力不足折不出痕。一个成功的策略必须协调双臂、读取力度反馈,力度分辨率要精细到能区分折痕和撕裂。
作为对比,同期进行的 用的是 Unitree G1 人形机器人,面对的是刚性部件、固定几何形状、以及靠摄像头就能看到的失败模式。两者都难,但只有折纸赛要求机器人感知它无法直视的东西。
比赛评委不是机器人专家,而是来自日本折纸协会(日本折紙協会)的折纸大师。评分标准只有一个:大师判定你折出来的东西是不是一架可辨认的纸飞机。每次尝试限时 10 分钟。成功的折叠按耗时排名。至于折出来的飞机能不能飞——「让它飞起来本身就是奖赏,不计入评分。」
比赛将于 2026 年 9 月 27 日至 10 月 1 日在匹兹堡 David L. Lawrence 会议中心举行,是 IROS 2026 的官方竞赛项目之一。组织方包括 BitRobot、FrodoBots Lab、Agility Robotics、日本折纸协会、Sharpa、Lightwheel 和丰田中央研究所,合作高校包括新加坡国立大学、斯坦福大学和清华大学。总奖金池高达 100 万美元。
476 万帧、十指力觉、65 维关节——数据集的每一层都在回答同一个问题
数据集的核心指标可以用一串数字概括:682 个 episode、51 个采集季、476 万帧、每秒 30 帧。但真正让它区别于绝大多数机器人数据集的,是触觉模态的深度。
每个指尖输出六轴力/力矩信号,十个指尖共 60 维触觉数据,与视觉和运动数据逐帧同步。触觉视频提供两种格式:原始传感器流(raw tactile)保真度最高,变形图(tactile deform)更轻量,适合快速训练。算上头部左右和腕部左右四路 RGB 摄像头,每个 episode 同步记录 6 路视频流。
关节空间状态和动作向量均为 65 维:左臂 7 维、左手 22 维、右臂 7 维、右手 22 维、躯干/电机 7 维。数据集完整支持 LeRobot 3.0 格式,可直接接入现有的模仿学习、视觉-触觉表征学习、长序列动作建模等管线。
Sharpa 在技术说明中强调了两项关键特性:低延迟——手指接触纸面的瞬间即注册信号,不会滞后数帧;以及对微弱力的灵敏度——薄纸产生的接触力极小,大多数触觉系统要么捕捉不到,要么被噪声淹没。SharpaWave 五指灵巧手据称能解析精细到足以区分「即将滑脱」和「稳定握持」的力变化。
硬件方面,所有参赛队伍使用统一的标准化平台:双臂搭配 Sharpa Hands 末端执行器,在仿真、远程评估和现场比赛中完全一致。队伍无需自备机器人,可以在 NVIDIA Isaac Sim 环境中训练策略,上传到远程实验室在真实硬件上跑分,最后再到匹兹堡现场比赛。
导航、刚性装配、可变形操作:BitRobot 的三张考卷同时铺开
的 benchmark 布局在这次数据集发布中变得更清晰。它的三大挑战赛分别覆盖具身智能的三类完全不同的失败模式:
(GC/01)考导航:自主策略对阵人类遥操作员,在城市人行道、室内走廊和越野小径上同场竞技。第三届,已有来自 Google DeepMind、NUS、NYU、普林斯顿等机构的研究者参与。
(GC/03)考刚性装配:人形机器人自主组装宜家 UTTER 儿童桌,从零件摊开到四条腿拧紧。标准化 Unitree G1 平台,500+ 遥操作 episode 供训练。
(GC/02)考可变形物体操作:六次折叠,纸会变形、自遮挡、对时机零容忍。触觉是这道题不可绕过的维度。
三张考卷共享同一个逻辑:在真实环境中、用真实机器人、以人类专家表现为基准。区别在于它们各自击中了 embodied AI 不同层面的脆弱点。折纸赛的特殊之处在于,它暴露了一个长期被回避的事实——没有触觉,这类操作根本无从谈起。
这正是 Sharpa 开源数据集的产业含义。触觉传感数据在公开领域的稀缺不是偶然的。高分辨率触觉硬件造价高昂,采集成本远超视觉数据,而且触觉信号与具体硬件强绑定——换一只手,数据未必可迁移。大多数商业实验室将触觉数据视为护城河。
Sharpa 在比赛前把数据公开,等于承认了一条隐含前提:这道题没有触觉数据,谁都做不出来。
赛前给数据,是自信还是认账?
在比赛开始前把训练数据交给所有对手,只有两种可能:要么组织方确信数据只是起点、真正的差距在策略层面,要么承认没有这份数据谁也跨不过门槛。无论哪种解读,结果是一样的——触觉操作从实验室的暗房被拖进了公开竞技场。而 IROS 2026 的匹兹堡赛场,将是第一场公开考试。