AREX Feed Article
卢宗青掏出50万小时Being-H0.8,纯模型硬刚软硬一体
7月28日,具身智能公司智在无界(BeingBeyond)正式发布隐式触觉世界动作模型 。模型预训练数据量从上一代的20万小时暴涨至50万小时以上第一人称人类视频,并首次在预训练阶段融入触觉信息。
一个机器人从背包里摸出指定物品,从袋子里夹起一片完整的薯片而不夹碎,用毛笔写出汉字。这些此前仅靠视觉难以稳定完成的任务,是Being-H0.8给出的答案。
「这是真正新的东西」:触觉从普通视频里长了出来
法国机器人研究者Léo(@LeoKharon)在8月2日发出一篇长线程,逐层拆解Being-H0.8。他的核心判断是:从普通视频里恢复触觉通道,。
但他同时列出几条硬伤:TactoHand预测的是接触位置和接近度,不是力的大小,「怎么用力压」这个问题仍然依赖机器人指尖的真实传感器;公司从未披露参数规模、benchmark基线或对照试验数据;50万小时是原始视频量,经过清理、去重、过滤后实际用于训练的保留语料规模并未公开。
「全是自报自评,机器人领域的benchmark老问题了。」Léo写道。
智在无界创始人、北京大学计算机学院长聘副教授卢宗青在随后接受「甲子光年」时回应了力的问题:「预训练模型首先解决的是接不接触,就是有没有挨住。你刚才提到力的大小,是另外一个从1到10或者到100的提升,更依赖后训练。」他说,人在操作时其实也不知道接触力到底有多大,「更多是感知一个范围。」
一年前投资人追问「为什么不做本体」,现在不问了
BeingBeyond成立于2025年5月。在行业里大多数明星公司选择软硬一体(自己做机器人本体、自己训模型)的背景下,卢宗青坚持只做模型。
「我每天都被投资人问:你们为什么不做本体?每个投资人来都会问一遍。」卢宗青对甲子光年回忆。到了2026年,这个问题消失了。「现在不问了,再也不问了。」
态度转变的背景是,纯模型路线在过去一年里获得了行业层面的验证。2026年1月,硅谷机器人大脑公司Skild AI在没有任何自研硬件的情况下完成了14亿美元C轮融资,估值从45亿美元跃升至140亿美元以上——。
BeingBeyond自己的迭代节奏也在加速。2025年7月的Being-H0仅使用1000+小时人类视频、覆盖150+任务,。2026年1月的H0.5膨胀到35,000+小时、适配30种机器人本体。4月的H0.7达到200,000小时。7月的H0.8直接跳到500,000+小时。从千小时级到50万小时级,只用了一年。
卢宗青的解释是:「H从0到0.8,其实是在健全整个体系。从数据Infra到预训练Infra,再到部署、真机,还包括评测。」
TactoHand怎么从视频里「算」出触觉
Being-H0.8的技术核心围绕一个根本矛盾展开:大规模人类视频不包含物理触觉传感器读数,但触觉又是灵巧操作中不可或缺的感知模态。
TactoHand是BeingBeyond自研的密集触觉伪标签系统。它在几何监督下训练:对大量手-物交互帧,先通过配准的手部和物体mesh获取表面级真值(面间距离和方向判定接触,距离同时给出接近度分级信号),然后训练一个时序模型从视频中推断这两个场。
二值接触图定位可能的接触区域,连续接近度场刻画手部各顶点距离接触还有多远。
部署到UniHand 3.0的50万小时数据上时,系统对每一段视频重建并追踪手部,逐clip施加TactoHand预测,再映射回统一的MANO手部拓扑。不可靠的重建片段被mask掉,而不是错误标成「无接触」。
金字塔式触觉编码器随后将接触、接近度,以及来自真实传感器(如有)的压力数据统一为一种触觉模态输入,。
另一项关键设计是TopoHand——第二代统一动作空间。它用一个由20个语义关键点和20个规范关节变量组成的「螺旋手」表征,将人手、五指灵巧手、平行夹爪纳入同一运动学接口。平行夹爪通过拇指与最近指尖距离导出的归一化开合值进入这个空间。
模型不再依赖特定本体的原始关节定义来学习操作策略,换一只新手的成本从采集一套新数据集变成了拟合十几个参数。Léo评价:「如果这个设计成立,它用表征而非蛮力数据的思路来解决『千手问题』,。」
第三个组件是慢-快动作专家(Slow-Fast Action Expert)。在每个动作时域开始时,慢专家计算并缓存一次「世界-动作上下文」;时域内少数几个锚点处,快专家注入最新本体状态与触觉反馈,动态修正当前动作片段。这解决了大模型推理速度跟不上高频控制信号的矛盾。
BeingBeyond还同步发布了轻量级边端世界模型Being-H-Flash,据称可在NVIDIA Orin NX等约100 TOPS级边端硬件上实现接近20 FPS的实时推理。
软硬一体的浪潮里,纯模型公司站住了
具身智能行业的主流叙事长期是「软硬一体」。多家头部厂商选择自研机器人和自研模型双线并进。逻辑很直接:模型最终要在真实本体上闭环,自己做硬件更容易协调软硬件迭代和真机数据回流。
卢宗青的反对逻辑同样直接:硬件尚未收敛,一旦被特定本体绑定,数据和模型都会随硬件迭代而腐烂。一个小团队不可能同时精通模型和本体。据 归纳,他的赌注是一个能跨任意本体泛化的模型。这迫使它必须真正通用,否则无法商业化。
这条路线正在获得更多同行者。据 报道,美团、蚂蚁、京东都已开始众包采集第一人称视频。robotbelt评论称,行业正在围绕一条路线收敛:用人类视频做预训练,再用真机或仿真数据做后训练。
Being-H0.8是这条路线迄今为止最大胆的一次下注。50万小时人类视频的规模在全球具身模型中首屈一指,触觉预训练的引入则把竞争从「谁的数据多」推向了「谁能从数据里提取更多模态」。
横向对比更具象。Léo在分析中指出了TopoHand与硅谷公司Generalist AI「千手问题」解决思路的本质差异:Generalist通过覆盖约9000种夹爪变体的数据来实现跨本体,BeingBeyond选择直接在表征层参数化本体空间。
「如果这个设计成立,加一只新手是拟合10个数字,而不是采集一套新数据集。」Léo写道。
但公开信息里,Being-H0.8没有第三方基准测试,没有参数规模,训练后保留了多少有效数据也未公布。卢宗青在采访中说,1.0版本将采用「一种全新的训练范式」,但拒绝透露细节。具身模型的评测困境依然无解。
50万小时之后,1.0还差一整个力的大小
Being-H0.8最大的动作是把触觉这个缺失已久的模态塞进了预训练管线。它标出了接触发生的位置和手离接触还有多远,但没有告诉模型按压的力度。
卢宗青承认这一点:「有没有这个模态非常重要。至于力是1还是10,和有没有接触相比,是次要一些的东西。」但真到了后训练阶段,从「挨住」到「用多大的力挨住」,仍然是每一只灵巧手必须在真实硬件上闭环补齐的功课。
他描述的1.0时代,一个同时具备视觉理解、触觉交互、动作生成、世界预测、跨本体泛化的具身基础模型,,骨架已经搭好,但血肉仍需真机的力反馈来填充。