AREX Feed Article
戴盟Daimon-TWM杀入物理交互:9项认知全第一,抗扰动十倍于π0.5
8 月 10 日,戴盟机器人正式发布 Daimon-TWM(Tactile-grounded World Model),并称其为全球首个触觉锚定世界模型。,在接触密集型操作任务中,该模型无扰动条件下平均成功率 64.0%,有扰动时仍保持 53%;同等条件下,π0.5 的成功率分别为 26% 和 6%。扰动环境中的操作成功率是 π0.5 的十倍。
物理认知九项核心指标全部第一,综合得分 60.1 分,领先触觉专用模型 SToLa 12.6 分,领先 GPT-4o 24.7 分。Daimon-TWM 的做法不同:它让触觉成为物理认知、推演决策和瞬时反应全阶段的锚点,而非当作辅助信号塞进视觉模型。
李飞飞的 T-Rex 证明了触觉有用,戴盟往前推了一步
今年,触觉对机器人操作能力的重要性已成为行业共识。李飞飞署名的论文 T-Rex 证明了触觉可以在接触发生后帮助模型纠偏。但 Daimon-TWM 试图回答一个更棘手的问题:能不能在接触发生之前就预测接下来会发生什么?
两者的区别不只是技术路线的选择。T-Rex 的逻辑是「接触后反应」:碰上了,感觉到不对,再调整。Daimon-TWM 的逻辑是「预测接触、主动调整」:交互还未发生,模型已经推演出未来的动态变化,并在接触变得密集时动态调整各表征的权重,让触觉成为判断下一步动作的关键证据。
戴盟机器人首席 AI 科学家原玮浩在此前接受采访时曾总结过这个差异:「视频世界模型在预测画面,我们在预测物理交互。」
「手感」说不清,通用大模型从未真正摸过一个物体
触觉为什么迟迟没能大规模进入具身模型?核心原因是「手感」本质上是一种连续信号,难以离散化为语言标签。描述拿起一个杯子的手感,涉及软硬、摩擦、形变、滑移等多个维度,而「软」与「硬」之间不是非此即彼,是「很软」「偏软」「较硬」这种连续谱。
这也是 GPT-4o 在物理认知测试中被 Daimon-TWM 拉开 24.7 分差距的原因。戴盟在技术报告 中给出了一个典型案例:一块看起来像塑料的物体,视觉模型(GPT-4o、Gemini-2.5-Pro、Qwen2.5-VL)一致判定为塑料,但触觉数据揭示其受力形变特征与橡胶一致。通用大模型读过海量文字、看过无数图片,却从未真正「摸」过一个物体。物理属性的判断,最终必须从接触中生长出来。
戴盟创始人兼首席科学家王煜在 ICRA 2026 的 《Touch Physical AI》中,将触觉模态的核心挑战归纳为三步:Represent(捕捉和处理高密度触觉传感器信息)、Acquire(通过规模化与开源解决数据稀缺与标准化缺失)、Leverage(构建「触觉原生」模型实现真正理解)。Daimon-TWM 正是对第三步的回答。
认知层:逼模型用「摸」的证据,不准偷看答案
Daimon-TWM 的物理认知能力来自其底层模型 Touch-R1。这个基于 Qwen2.5-VL-7B 的触觉推理多模态模型,训练方式与标准监督微调有本质区别。
Touch-R1 引入了「触觉锚定 GRPO」目标:模型在回答物理属性问题时,只有当真实触觉输入确实提升了正确率(相比移除、打乱或噪声掩码触觉信号的对照组),才能获得触觉使用奖励。这种设计直接堵住了模型绕过触觉、依靠视觉或物体类别先验「猜答案」的捷径。
同时,物理属性的评估不再使用粗暴的二元对错。序数感知准确度奖励(Ordinal-Aware Accuracy Reward)让相邻级别的误判(比如把「偏软」判成「软」)受到的惩罚小于跨级误判。跨传感器物理一致性奖励则鼓励不同触觉传感器在观察同一物体时,在物理属性空间达成一致,而不要求像素级对齐。
这套机制训练出的模型,在推理时会产生结构化的感知-比较-修正链条,而非直接输出一个标签。在视觉与触觉冲突的场景中(比如视觉将橡胶判定为塑料、将带图案的光滑表面判定为粗糙纹理),模型会依据触觉证据修正视觉先验。
戴盟公布的物理认知九项指标中,Touch-R1 全部取得第一,综合得分 60.1 分。
执行层:预测下一刻的接触,而不是下一帧画面
如果说认知层让模型「懂」物理,执行层的任务是在懂的基础上「用」物理。Daimon-TWM 的执行架构来自另一篇技术报告 ,核心机制可以拆成两层。
上层是触觉思维链(T-CoT)与由粗到细的未来触觉预测。模型围绕接触阶段、接触状态和潜在失败风险进行推演,提前预测接下来会发生什么。在双齿轮装配任务中,模型预测的触觉变化曲线与实际测量值几乎完全重合。这对纯视觉模型而言近乎不可能,因为齿轮的齿牙咬合状态无法从外观完整推断。
下层是一个 100Hz 高频触觉-动作混合控制器。上一层负责理解任务、给出整体策略(慢规划),这一层根据实时触觉反馈对动作进行毫秒级修正(快纠偏)。物体刚开始滑移的瞬间,补偿动作就已经发出,新的视觉帧甚至还没生成。
戴盟的消融实验用 USB 插拔成功率验证了这套分层架构的系统性:仅用触觉的基线成功率 30%,逐步叠加 T-CoT(+8%)、粗粒度预测(+7%)、细粒度预测(+5%)、触觉-动作控制器(+12%),最终达到 62%。去掉任何一环,成功率都会下滑。
440 万次下载的数据集,和一个「师门」的触觉赌注
Daimon-TWM 的能力不只是模型架构的产物。它训练所用的 数据集,覆盖上万种物体、跨材质的千万级物理交互数据。据戴盟披露,该数据集目前在阿里魔搭社区获得超过 440 万次下载,位列该社区物理世界数据集第一名。今年 4 月,,戴盟联合 Google DeepMind、中国移动、新加坡国立大学、北京大学、清华大学等全球数十家机构共同发布了 Daimon-Infinity 数据集,其中首批 10000 小时数据在阿里魔搭社区开源。
这套数据基建扎根于戴盟的学术基因。创始人兼首席科学家王煜,是「全球机器人灵巧操作之父」卡内基梅隆大学教授 Matthew Mason 的首位博士生,在斯坦福大学发布的「终身科学影响力排行榜」中位列全球前 1%。联合创始人兼 CEO 段江哗是王煜的学生,从十年前就开始深耕机器人操作研究。今年 6 月加入的首席 AI 科学家原玮浩,此前任职于阿里通义实验室,拥有多模态大模型迁移至机器人物理操作的前沿经验。
今年 6 月,戴盟完成亿元 A 轮融资,由汇川产投和中国电信联合投资。融资到账后重点投向物理世界模型研发、含物理交互信息的超大规模数据集和真实场景下的数据飞轮。原玮浩当时的说法是:「数据是燃料,物理世界模型是引擎,飞轮决定引擎能不能持续跑起来。」
回到 Matthew Mason 写在个人主页上的那句话:「The dexterity of a hand is mostly about the brain, not the hand.」Daimon-TWM 试图证明的,正是这个「脑」的核心不在视觉,不在语言,而在每一次真实的触碰中生长出来的物理常识。当 π0.5 在扰动环境中成功率骤降到 6% 时,Daimon-TWM 守住了 53%——这 47 个百分点的差距,大致就是「看见再行动」与「预测接触、边做边恢复」之间的距离。