AREX Feed Article
自变量发布 TwinDex,宣称以零真机遥操数据完成化学实验
9 月 3 日,自变量机器人发布灵巧操作系统 TwinDex。当日上午报道了它的演示:公司宣称,机器人策略的后训练阶段真机遥操(teleoperation,远程操控真实机器人示范)数据为 0,仅用数百条“无本体”(robot-free,指不经过目标机器人、由操作员穿戴采集设备示范得到的数据)数据从零训练,机器人就一镜到底自主完成了一套含 24 个子动作的化学实验。
TwinDex 的硬件是一对同构设备:三指、9 自由度(其中 7 个主动驱动)的灵巧手,配一副可穿戴采集外骨骼。官方给出两个核心数字:采集效率较真机遥操提升 5.3 倍以上、等量数据训练效果 ≈1:1。以上均为公司演示口径:论文尚未发布,页面也没有给出权重或复现材料,目前能核对的只有公司自述与媒体转述。
工具箱卡扣、注射器推注:演示里的三类能力
量子位转述的演示中,最完整的一段是这套一镜到底的化学实验:从开瓶取样、滴管与试管操作,到玻璃棒引流、摇匀观察,全程由策略自主执行。
实验跨越三种工具,涉及多次双手协调与工具切换,每一步都要求毫米级定位与稳定力控。量子位把演示里的能力拆成三类,第一类是容差极小的精细操作。
打开工具箱时,机器人要让左右两根食指同时对准两个狭窄卡扣,插入后向下拨开,再用食指和拇指捏住提手掀起箱盖。
注射器推注则是食指与中指固定筒身、拇指对准推杆向前发力,位置不能跑,推注方向和力度都要精确。
第二类是三指协作。扫帚和簸箕任务里,三根手指围绕手柄形成包络,共同承担支撑与控制;相比两指,第三根手指多提供一个接触点,也多一种稳定长条物体、使用工具的方式。
第三类接近人手的柔性操作与掌内调整:翻书时,拇指先把最上层书本搓出来,再完成捏取、双手交接、放置和翻页。
官方页面把这段演示标注为 One Take(一镜到底),称它是一套“标准的化学实验”,由策略在单次无剪辑拍摄中自主完成。所有策略只用无本体数据从零训练,官方称任何阶段都没有引入干预数据或真机遥操数据。
三根手指,凭什么拿下毫米级操作?
TwinDEX 由拇指、食指、中指构成。官方称三指是“最小可行方案”:手指越多,灵巧上限越高,但空间堆叠、驱动器力矩密度、可靠性与成本会连锁恶化;两指夹爪则很难覆盖旋拧、掌内调整、多点接触这类精细操作。
公司称,经过覆盖 8 类操作原语的形态学基准测试、与多种候选构型对比后,三指 9 自由度是当前的最优折中。
自由度分配能看出取舍。拇指共 4 个自由度、3 个主动,其中腕掌关节(CMC)双主动,官方称这是拧螺丝类任务的关键,能显著减少对手腕转动的依赖。
食指的 3 个自由度全部主动驱动,承担触觉反馈与发力;中指只有 1 个主动自由度,负责辅助稳定大物体抓取,近端指间关节(PIP)通过四连杆被动跟随。
9 个自由度由 7 个主动驱动器带动。对比实验支撑了这个配置:官方比较了 6、7、8 个主动自由度的三指构型,7 与 8 主动相对 6 主动是“量子跃升”。
但 8 主动相对 7 主动的增益有限,多出的复杂度主要换来穿戴舒适性,最终锁定 7 主动版本。
拧瓶盖演示是官方给出的一个具体例证:一只手扶稳瓶子,另一只手靠食指与拇指的外展、内收自由度完成旋转,而不是转手腕。官方写道,这正说明手指级自由度对这类就地精细操作必不可少。
一致性设计:把本体对齐挪到数据产生之前
TwinDEX 不只是一只手。量子位把它称为由数据采集硬件、末端执行器、数据处理管线和模型训练流程共同组成的灵巧操作系统,并总结说,这套系统的各个环节都围绕同一个问题展开:让采集出来的数据,从一开始就尽可能接近机器人真正需要的数据。
无本体数据过去好采但难用。采集端和执行端不是同一套本体,人手怎么动、设备怎么记录,到了机器人上未必能原样复现,运动学差异和精度损失,迫使团队最后补一批真机遥操数据做本体对齐。
TwinDEX 的做法是倒过来设计:官方称从“零真机数据部署”这个目标出发,反推采集端在关节精度、时间同步、视觉配置、机械特性上必须达到的指标。
页面把采集端与执行端的一致性拆成五个维度。运动学严格同构:自由度数量、关节轴配置、连杆比例一致,外骨骼每个旋转轴与手部对应关节共轴。
接触力学一致:接触表面的材质、几何与表面特性相同,同位置集成相同触觉传感器。视觉外观接近一致:接触物体的壳体相同,非接触的驱动模块用织物覆盖,缩小视觉域差异。
还有两个维度针对数据本身。采集精度被逐项量化:手指关节精度、手腕定位精度、抖动、漂移对闭环性能的影响权重不同,部分误差模型能容忍、部分是硬瓶颈,模型架构与训练流程据此设计。
多模态时间同步则量化视觉、触觉、关节编码器、手腕定位之间的时间错位对策略推断的影响。
量子位的概括是“所采即所得”:把原本发生在数据处理阶段的本体对齐,提前到了数据产生之前。
采集端是可穿戴外骨骼,操作员戴上设备直接接触物体,获得真实力反馈,系统同步记录视觉、关节状态、手腕位姿等多模态信息,经标定、时间同步和标准化处理后汇入统一训练空间。
多名操作员可以在不同地点同时采集,互不占用机器人。公司留了一句话的余地:外骨骼结构上与真机遥操兼容,可直接充当高精度遥操设备,官方称这项能力保留为未来更高难度场景补充干预数据的接口,但“当前结果不依赖它”。
采集更快、轨迹更顺:三层机制与一条数据曲线
官方为采集效率的提升给出了三层机制。第一是成功率:旋拧瓶盖、精细插接这类接触密集任务,在传统遥操下缺少直觉力反馈,很难稳定完成,穿戴式让操作员直接感知接触力。
第二是速度:操作员按自然节奏动作,不用适应通信延迟和映射畸变。第三是轨迹质量:穿戴采集的轨迹更平滑自然,少了遥操常见的抖动、停顿和非人运动模式。
采集端不占机器人,也让成本结构变了:不需要机械臂、底盘或轮式平台,硬件压缩到一副外骨骼加一套传感器。
一人、一桌、一外骨骼就是一个完整采集单元,可以带去任意真实环境现场采集。官方称采集效率较真机遥操提升 5.3 倍以上,同时维持相当的数据质量。
另一组对比针对数据本身的价值。官方称在多任务基准上,无本体数据与真机遥操数据训练出的策略数据效率相当:性能随数据量以相同速率提升,两条曲线在统计显著范围内重合,即无本体数据与遥操数据具有同等的“价值密度”。
量子位转述这一结果时写道,在这组实验中,无本体数据近乎可以 100% 替代真机遥操数据。
“遥操已死”之后,轮到无本体数据作答
量子位的报道为这场发布提供了背景:今年 5 月,英伟达机器人负责人 Jim Fan 在一场公开演讲中宣告“VLA、遥操已死”,当时多数人把这当作又一条暴论。几个月后,面对这份演示,量子位在文中写道:“遥操,可能真的危险了。”
报道回溯了这类数据此前的地位:过去两年,真机遥操数据站在“具身数据金字塔”的塔尖,质量最高,因为视觉、关节状态、末端轨迹天然对齐。代价也最大:每采一条都要真实占用一台机器人,机器人保有量成了数据产能上限。
为了摆脱这个上限,行业在探索 UMI 一类两指夹爪、手套与外骨骼、Ego 第一视角等无本体采集路线,但一直卡在一个两难里:采集方式越自由,越容易扩展规模;采集端离真实机器人越远,动作重定向和精度损失越大,数据越难直接用。
TwinDEX 的答案是不放弃本体约束,把机器人需要的动作结构提前“复制”到采集端,在可扩展性和物理信息保留之间另找一个平衡点。
自变量机器人是国内具身智能公司,其自称专注端到端大模型驱动的通用机器人,围绕自研的 WALL-A 操作大模型布局,产品线包括量子系列轮式仿人机器人和五指灵巧手 ArtiXon Hand。
量子位在文末给出判断:高质量数据与真机遥操之间的强绑定正在松动,“每扩展到一个新任务,都必须从真机遥操数据开始的时代,正在结束”。
声明与验证之间,隔着一份 coming soon
TwinDex 项目页顶部只挂着一个标注 “Paper (coming soon)” 的入口,文末的 BibTeX 同样写着 coming soon。除演示与页面自述外,页面上看不到论文正文、模型权重,也没有第三方评测的入口。
页面在多处注明,逐维度的消融、分析与讨论将放在技术报告里;报告目前没有随页面公开。
公司自己在页面里列了边界:任务目前限于单一桌面工作区、物体类别有限,对大规模物体形状变化和未见场景布局的泛化仍有提升空间;长时间穿戴采集的人体工学尚未系统研究;多指精密装配这类更高灵巧任务,可能需要更多自由度的构型。
连最基本的数字,官方口径也不统一:项目页概述写化学实验含 25 个子动作,页面结论部分和量子位报道则记为 24 个。
在论文与报告公开之前,TwinDex 可以核实的部分是一套已上线的硬件方案、一段演示和两个待检验的数字。“无本体数据 ≈ 真机遥操数据”仍是一句公司声明,验证它的材料还停在 “coming soon” 里。