AREX Feed Article
BeingBeyond 意外曝光:不碰机器人硬件,这家北京初创用 50 万小时人类视频训练机器人大脑
2026 年 8 月 8 日,专注于具身智能领域的 X 用户 发布了一条推文,将一家低调运行超过一年的北京初创公司推到台前。推文在一天内获得 237 次点赞、31 次转发和 116 次书签,浏览量超过 1.5 万。
这家公司叫 BeingBeyond(智在无界)。与多数具身智能创业公司不同,它不造人形机器人,不碰硬件本体。BeingBeyond 走的是一条纯粹的"机器人大脑"路线:只做具身智能基础模型。
但这不意味着它什么都没造出来。过去一年,这家公司构建了从视觉感知、空间理解到灵巧操作和全身运动控制的完整模型体系。其旗舰模型 Being-H0.7 在 6 项国际评测中综合排名全球第一;最新模型 Being-H0.8 的训练数据超过 50 万小时,并首次引入触觉模态。所有模型均在 HuggingFace 开源。
四套模型,手、眼、身、行全覆盖
BeingBeyond 目前公开了四套核心模型,各自承担机器人智能的不同环节。
系列是跨模态通用基础模型,统一三维空间理解与人类语言意图,负责从感知到推理规划的完整链路。Being-H 系列专注手部灵巧操作,基于海量人类操作视频预训练,让机器人灵巧手在少量真机数据下快速掌握新任务,覆盖从精细装配到工具使用等场景。Being-M 系列负责全身动作生成,连接"大脑"和"身体",根据高层指令生成符合物理规律的全身动作序列,可跨不同机器人本体泛化。Being-W 是最底层的全身运动控制模型,通过强化学习在海量人类数据上训练,实现零样本稳定执行,解决人形机器人的核心控制难题。
四套模型构成了一条从"看懂世界"到"动手做事"、再到"全身协调运动"的完整技术栈。用公司官网的话说,它们"以大规模人类数据为基础,致力于具身通用基础模型"。
20 万小时视频训出"物理直觉",H0.7 横扫六大榜单
BeingBeyond 最核心的技术赌注,是"用人类视频训练机器人"。
传统机器人模型的训练数据来自机器人在仿真环境或真机上的演示,采集成本高、规模有限。BeingBeyond 的路线截然不同:它从互联网上收集海量人类日常行为视频,包括走路、跳舞、抓取物体、使用工具,将其中的动作结构转化为模型可学习的时空表征。
这条路线最早在 Being-H0 和 H0.5 上得到初步验证,分别使用了一千小时和一万小时的人类视频。但真正让行业注意到这家公司的,是今年 4 月发布的 。
H0.7 将训练数据规模扩展到约 20 万小时人类第一人称视频,并引入了一套全新的潜空间推理(latent-space reasoning)机制。传统的视频生成式世界模型试图逐帧预测未来画面,计算量巨大且难以抽象物理规律。H0.7 放弃了这条路,转而让模型在隐空间中学习一种类似"物理直觉"的快速判断能力:物体将向哪个方向运动,接触关系会如何变化,施加的力会导致稳定还是失衡。
实现上,H0.7 采用双分支架构。后验分支在可见未来的条件下学习哪些中间判断对动作决策真正有用;先验分支在不可见未来的真实部署条件下,仅基于当前观测形成尽可能一致的判断。两者持续对齐,模型由此学会在"思考空间"里推演对后续动作真正有用的信息。与注入未来信息的单向方案不同,H0.7 的双向约束让模型逐步获得了接近人类"物理直觉"的推理方式:不看未来的每一帧画面,却能判断接下来的物理变化。
在 6 项国际权威评测中,H0.7 综合排名全球第一,其中 4 项单独登顶。它也是首个同时覆盖跨本体、跨场景、连续动态、流体、柔性物体、物理规律和上下文推理七大维度的通用世界模型。在推理速度上,H0.7 比视频生成式世界模型快约 40 倍。
数据规模的故事并未停在 H0.7。据 ,H0.5 阶段已覆盖 30 多种机器人本体的数据,H0.7 达到 20 万小时,而 7 月 28 日发布的 Being-H0.8 将规模推到 50 万小时以上,并首次引入触觉模态。将其定义为 Latent Tactile World Action Model,称其"首次将触觉带入大规模具身基础模型预训练"。
不止于手:M0.7 把世界模型扩展到全身
手部灵巧操作只是具身智能的一个维度。7 月 15 日,BeingBeyond 发布了 ,全球首个全身移动操作隐式世界动作模型(Latent WAM)。
M0.7 要解决的问题更复杂:人不只是坐在桌前用手做事,还要边走边看、边移动边操作。模型基于超过一万小时的人类第一人称视频和运动数据预训练,采用 MoT(Mixture-of-Transformers)架构,让视觉和运动各自拥有独立处理通道,只在需要时交换信息。这种设计让不配对数据也能被充分利用:纯视觉数据贡献于感知流,纯运动数据贡献于动作流,极大扩展了可用数据规模。团队还引入了一套统一的运动表征,将人类运动与人形机器人轨迹纳入同一表示空间,解决了人机本体形态差异带来的迁移难题。
发布会展示了四个 Demo:机器人从鱼缸中捞鱼,需要理解流体浮力对渔网和鱼的不同作用;根据镜中画面判断隐藏物体的真实位置并抓取,考验对镜面反射物理规律的理解;走到桌前先取法棍放入篮子再取花束转身离开,展示全身移动与灵巧操作在长程任务中的协同;抱着箱子侧身通过狭小区域,在负载遮挡第一人称视角的情况下自主决策避障路线。这些任务都需要机器人真正理解物理世界如何运转,而非仅靠模式匹配。
在工程侧,BeingBeyond 也做了部署优化。其轻量级模型 Being-H-Flash 据称在 NVIDIA Orin NX 上跑到接近 20 FPS,意味着模型可以端侧实时运行,不需要依赖云端算力。
所有模型均在 开源,包含模型权重、论文和训练数据集,累计已发布 13 个模型和 14 个数据集。
北大班底、联想押注、前逐际动力 COO 加盟
BeingBeyond 的创始人是北京大学计算机学院长聘副教授 。他是智源学者、国家级青年人才,曾担任北京智源人工智能研究院多模态交互研究中心负责人,长期深耕强化学习领域,在 ICML、NeurIPS、ICLR 等顶会担任(高级)领域主席。卢宗青在学术体系中最被业内熟知的方向,正是"大规模人类视频训练模型",这也直接塑造了 BeingBeyond 的技术路线。核心团队成员多来自北大、人大和智谱 AI。
2025 年 6 月,公司完成了一轮数千万人民币的融资,由联想之星领投,星连资本(Z 基金)、燕园创投和彬复资本跟投,Potential Capital 担任独家财务顾问。联想之星合伙人高天耀当时表示,BeingBeyond 的模块化技术路线"解决了训练数据来源受限的问题",与国外同类团队相比"具备全栈技术能力"。星连资本合伙人王璞则提到,团队从"构建业内首个百万级 MotionLib 数据集到开发端到端 Being-M0 动作生成模型",在具身智能领域验证了"大数据+大模型"的规模效应。
2026 年 4 月,逐际动力(LimX Dynamics)前联合创始人兼 COO 张力加入 BeingBeyond 担任 COO。据,张力此前在自动驾驶公司文远知行(WeRide)担任 COO 超过五年,是 L4 自动驾驶落地运营的关键人物,主导了与广汽、博世等主机厂和 Tier1 的战略合作。2023 年转投人形机器人公司逐际动力后,负责全球战略规划和政府关系。一位接近张力的知情人士称,张力加入 BeingBeyond 后明确表示,主要工作是"推动和更多机器人本体企业的合作,让更多机器人用上 BeingBeyond 的具身智能大脑"。
从纯研究团队到引入产业背景的 COO,这步棋意味着 BeingBeyond 正在从"快速演进的技术团队"向"可规模化运转的公司"过渡。
NVIDIA、Google 都在追同一条路
BeingBeyond 并非唯一押注人类视频训练路线的团队,但它是最早的一批。
在它之后,NVIDIA 推出了 DreamDojo,用约 4.4 万小时第一视角人类视频训练机器人世界模型,试图让模型学习开放世界中的交互、接触和物理变化。Google DeepMind 的 Gemini Robotics 将视觉、语言和动作连接起来,在 Gemini Robotics-ER 中强化空间理解和具身推理能力。Generalist AI 发布 GEN-1,强调通过大规模真实世界数据和从头训练的具身基础模型,提升机器人在简单任务上的可靠性、速度和异常恢复能力。这些进展指向同一个方向:具身智能正在从"硬件驱动"转向"模型驱动"。
但 BeingBeyond 的独特之处在于,它是这条路线上的纯软件玩家。公司不制造机器人本体,而是通过与机器人 OEM 合作的方式将模型部署到不同硬件上。其官网列出的硬件生态包括灵巧手数据采集系统、桌面操作平台、遥操作设备,以及正在推进的机器人本体企业合作。这些硬件的定位是数据采集和模型验证工具,而非独立产品线。
在推文中写道:"中国正在产生一批独特的公司,它们押注人形机器人最大的机会可能在于跨多种身体的'大脑层',而不是再去造又一个机器人身体。"
推文之外的反应:好奇与质疑并存
这条曝光推文在评论区引发了不同方向的讨论。
NVIDIA 前研究员、得克萨斯大学达拉斯分校机器人学研究者 提出了一个技术疑虑:"这些数据没有头部摄像头。这可能是个问题。"他指出数据采集方式可能影响模型在真实机器人上的迁移效果。
机器人公司 CosmicBrain 的 则质疑纯软件路线的根本可行性:"纯软件玩法是在赌你可以在没有真实世界部署数据的情况下造出机器人大脑。当你的策略从未碰过一个贴错胶带的纸箱、或者比 CAD 模型偏了 2 厘米的货架时,我很好奇这怎么工作。"
也有不少从业者表达了乐观。机器人工程师 评论道:"中国最近在机器人和 AI 方面确实在出货,关键是它们真正先理解了问题本身。" 则认为"把机器人大脑从硬件中拆出来是现在最聪明的玩法,让 OEM 在身体上烧钱,这些人只管跨所有硬件扩展软件"。
用户 补充了一个事实细节:BeingBeyond 的训练语料已上传至 HuggingFace。
这些声音勾勒出一个行业在路线尚未收敛时的真实状态:有人押注纯软件,有人坚持软硬一体,没人知道哪个答案是对的。但所有人都意识到,具身智能的竞赛规则正在被重写。
纯软件的赌局,赌的是哪一个瓶颈先被突破
BeingBeyond 的底层假设是清晰的:通用机器人的真正瓶颈不在硬件。人形机器人的身体各家都能造,成本也在快速下降,真正的稀缺品是那个能理解世界、做出决策、适应新场景的"大脑"。如果这个假设成立,专注于模型层的公司就有可能成为整条产业链的核心价值节点。
但这仍然是一个赌局。纯软件路线面临的最大挑战,是模型在脱离深度硬件耦合后能否保持真实世界的可靠性。质疑者提出的问题并不容易回答:仿真和视频中学到的"物理直觉",在面对现实世界中那些 CAD 模型不会标注的微小偏差时,是否仍然有效?
BeingBeyond 用 H0.7 的多项评测第一名和 H0.8 的 50 万小时训练数据给出了自己的初步答案。但这个问题的最终裁决,不来自论文和榜单,而来自那些真正走进工厂、仓库和家庭的机器人。