AREX Feed Article
NVIDIA 开源 T-Rex:'迄今最大触觉数据集'当天就被 800 小时数据反驳
8 月 21 日,NVIDIA 机器人研究负责人 Jim Fan 在 X 上宣布,NVIDIA 与 Berkeley 合作的开源触觉研究体系 T-Rex(Tactile-Reactive Dexterous Manipulation)发布。发布物分两块:一套"双时钟"混合 transformer 方法,慢速视觉运动专家负责规划,快速触觉专家以每 1 个视觉 tick 4 次的频率实时修正动作;以及一个已上架 Hugging Face 的触觉数据集,推文称其约 50 小时、约 5,500 条轨迹,采集自 22 自由度的触觉手硬件,并称它是"据我们所知迄今发布的最大触觉数据集"(the largest tactile dataset ever released to our knowledge)。
"触觉是机器人学里被开发得最不充分的感觉模态",Jim Fan 写道。他的比喻是:想象戴着厚烤箱手套做手部戏法,今天的机器人摸东西就是这种感觉;磁铁咔哒一声吸附到位、纸杯从杯摞里被揭起、USB 插头摸索着对准接口,这些接触瞬间,相机全都看不见。推文附带一段演示视频;截至 UTC 时间 8 月 22 日 0 时 27 分(发布约 8 小时后),该推文累计约 6.1 万次浏览、413 个赞。
两只时钟:触觉以 4 倍频修正视觉
双时钟的由来是一个频率错配。相机画面按帧到达,接触力却以毫秒变化:"力的变化比画面帧到达得更快,所以架构也必须更快"(Forces change faster than frames arrive, so the architecture had to as well),Jim Fan 这样解释。
T-Rex 的模型是 mixture-of-transformer,并排三个专家:latent expert 预测未来视觉表征,action expert 以慢节奏生成粗略动作,tactile expert 做高频残差修正。推文把节奏概括为"双时钟":慢速视觉运动专家,配上每 1 个视觉 tick 触发 4 次的快速触觉专家。
给出了两个时钟咬合的具体机制:异步级联 flow matching 把动作轨迹在 τ=0.4 处切开,action expert 用 6 步积分上半段,把视觉语言上下文缓存为冻结快照;tactile expert 克隆这份缓存,用 4 步完成下半段,并在每个慢 tick 内的 {0, 4, 8, 12} 偏移处重新触发——即每 1 个视觉 tick 对应 4 个触觉 tick。触觉专家不重跑视觉塔(never re-runs the vision tower)。图注给出的频率口径是 action expert 约 5 Hz、tactile expert 约 20 Hz。
触觉信号进入模型前先被压缩:每个指尖一个时间触觉 VQ-VAE,把 16 帧原始 6 轴力/力矩窗口编码成 256 维向量,量化进 K=64 的码本,每根手指产出一个离散 token;指尖形变图另由冻结的 ResNet 编码器处理。
T-Rex 架构图:慢速 action 专家与快速 tactile 专家共享多模态上下文,触觉专家以 4 倍频做残差修正。图源:arXiv:2606.17055。
按"物品 × 运动原语"组织的 50 小时数据
上的实际数字与推文的"约 5,500 条"略有出入:5,464 条轨迹、5,473,459 帧,30 fps 下约 50 小时;其中 5,370 条带人工校验的语言指令,覆盖 22 个运动原语与 207 件物品;总大小 1.53 TB,MIT 许可,LeRobotDataset v3.0 格式。
数据集的设计刻意绕开"录长任务":把 207 件日用品与 22 个运动原语(wrap、fold、cut、insert、peel、screw 等)两两配对,剔除物理上不可行的组合后得到 502 种配对,每种收集约 17 条演示。作者的理由是,短小、可复用的接触丰富行为能组合出复杂技能。
采集硬件是双臂的 Dexmate Vega-1(每臂 7 个驱动关节)配两只 22 自由度的 Sharpa Wave 灵巧手,每只手 5 个指尖触觉传感器;头戴 ZED X Mini 双目相机加两只腕部相机,全部 640×360。操作员用 Manus 手套与 VIVE tracker 遥操作,控制链路与部署时相同:30 Hz 高层线程记录观测与目标位姿,300 Hz 低层线程执行控制。触觉视频用无损 H.264 存储,理由是这些像素值本身承载物理信号。
T-Rex 数据集采集设置:Manus 手套与 VIVE 追踪器遥操作双臂机器人,头戴相机与腕部相机同步记录。图源:arXiv:2606.17055。
训练配方扩展自 NVIDIA 此前的 EgoScale:先用 22,889 小时人类第一视角视频做预训练(不含触觉),再用这批触觉机器人数据做中训,最后每个任务用约 100 条演示微调。Jim Fan 称实验表明这一配方"把无接触的预训练与接触丰富的操作衔接得相当好"(bridges contact-free pretraining to contact-rich manipulation remarkably well)。
推文说"今天上线",数据集 6 月 19 日就已公开
T-Rex 的公开时间线比这条推文早两个月。论文 6 月 15 日已上 arXiv,34 位作者的单位包括 UC Berkeley、NVIDIA、Stanford、Panasonic、意大利 La Sapienza 大学与 ItalAI;5 月 31 日创建,MIT 许可。6 月 19 日,介绍 T-Rex,宣布"完全开源数据集、模型、遥操作栈、训练代码与推理管线",推文里已附上同一个 Hugging Face 数据集链接;Jim Fan 在中称,该项目由 Dantong Niu 主导、Trevor Darrell(UC Berkeley)共同指导。
因此,"今天上线 Hugging Face"(Available today on HuggingFace!)至少不是该数据集的首次公开。
口径同样需要分开:一作与论文口径的完整数据集是 100 小时、7,700+ 条轨迹;上架 Hugging Face 的是约 50 小时子集(5,464 条轨迹)。开源边界在仓库 README 中写得很清楚:主分支只发布后训练与推理代码,预训练与中训语料不在本次发布之列;Hugging Face 上放出预训练与中训两个 checkpoint,用户从后训练阶段开始微调自己的任务。
"迄今最大"刚说出口,Technion 研究员就晒出 800 小时数据
发布一个多小时后,以色列理工学院(Technion)AI 与机器人学研究员 Aviv Tamar 在中晒出自家数据:人工触诊(artificial palpation)语料超过 800 小时,"比这个大一个数量级以上",并明确注明"不是用于操作,而是用于触觉场景理解"。
"最大"的度量口径随即被公开追问。自称逐条核对 AI 公告的资讯作者 :"最大"是按小时、接触事件还是传感器种类算?有没有与既有公开数据集的对比表?传感器硬件是否文档化到可复现?
两条技术性质疑指向硬件。X 用户 ,比触觉 tick 比率更难的是硬件迁移:触觉传感器不像 RGB 相机那样标准化,在一只 22 自由度手上采集的 50 小时,未必能迁移到另一套传感器栈,换硬件可能就得重训触觉专家。个人简介为"在旧金山部署人形机器人"的 (Cosmic Brain AI)则提醒,相机便宜又可靠,触觉硬件仍然脆弱、随时间漂移、坏了难以诊断——50 小时数据背后,"不知道是多少小时的传感器更换与重标定"。
65% 的平均成功率,和"最大"一样未经独立验证
方法层面的数字同样只有作者口径。项目页称,T-Rex 在 12 个真实操作任务(翻书页、转移鸡蛋、拧灯泡、挤牙膏等)上平均成功率 65%,比最强基线 EgoScale(35%)高 30 个百分点,12 个任务全部排第一;消融实验显示,去掉触觉后平均成功率从 65% 掉到 42%。这些结果均为作者自测。
作者在论文与项目页里自列的边界包括:难以遥操作的紧公差长程任务、传感器失真与跨设备标定漂移、只有指尖传感而缺少手掌密集传感。
Jim Fan 给这轮发布的定性是:"像素便宜又无处不在,但在接触的瞬间就失效了,触觉将承担最后一英里"(Tactile will carry the last mile),"下一轮 scaling 曲线将以触觉的小时数来衡量"(The next scaling curve will be measured in hours of touch)。他这次开源的是 50 小时、5,464 条轨迹;Tamar 晒出的是 800 小时。项目页与数据集页面都没有给出与既有公开数据集的对照表——"迄今最大"的标尺,还悬在这两组数字之间。