AREX Feed Article
蓝鲸新闻:具身大脑半年融222亿,本体派仅拿56亿
2026年8月8日,,披露了上半年国内具身智能赛道融资数据:总融资437.66亿元。
其中,以具身大脑为核心业务的"大脑派"公司拿下222.53亿元,占比50.8%。以机器人本体整机为核心的"本体派"公司同期融资仅56亿元,占比12.8%。
接近4倍的差距指向了一个判断:资本正在从"身体"撤向"大脑"。
上半年融资版图的五个数字
综合蓝鲸新闻的报告和,上半年具身智能融资有五条关键信息。
第一,大脑派35家公司中,20家仍停在种子轮到Pre-A轮,没有一家融到C轮。但Pre-A轮平均单笔融资已达7亿元,B轮平均22.5亿元——放在其他赛道,这是C、D轮的量级。
第二,在大脑赛道内部,,世界模型占27%,数据基础设施占20%,端侧芯片占11%。
第三,全球合规可用的真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的两万分之一,缺口超过99%。
第四,2025年中国具身智能市场规模已达9150亿元,同比增长20.4%,分析师预测2026年将达10904亿元。
第五,大脑派公司的融资节奏快到平均一个月一轮,有企业两轮融资间隔只有两周。
"借脑"还是"造脑"
宇树的机器人可以在舞台上后空翻,智元的机械臂能在实验室里拧螺丝。但面对传送带上微微偏移的包裹、货架上被顾客挪动过的商品、甚至一扇透明的玻璃门,这些灵巧的"身体"表现大打折扣。行业用两年时间完成了本体能力的快速迭代,却撞上了一堵更厚的墙:硬件越做越强,真实场景越跑越吃力。
为什么通用大模型接上身体就失灵
2024年初,Figure AI与OpenAI达成合作,由后者提供语言模型支持机器人实现对话、推理和规划。这个决策逻辑在当时几乎无可指摘:互联网已经训练出了能理解复杂语义的模型,为什么不直接拿来用?
此后很长一段时间,这条"拿来主义路线"成为行业主流:用面向数字内容创作的视频生成模型做底座,再通过微调适配机器人。
Physical Intelligence的π系列、英伟达的GR00T N1.7、Google的Gemini Robotics,以及国内绝大多数具身智能团队,都走这条路。
这套方法论在实验室和标准化演示中表现亮眼。但机器人进入真实环境后,问题开始暴露。
物流仓库传送带速度会有细微波动,药房货架上的药品包装并非完全统一,工厂车间的光照条件随时变化。这些在人类看来微不足道的差异,足以让通过迁移学习适配机器人任务的模型失效。
蓝鲸新闻在报告中点出了根本原因:将原本用于理解世界的模型改造为机器人大脑,训练目标本质上仍围绕预测下一帧或理解语义。机器人需要回答的核心问题是"我的动作会让世界发生什么改变"。前者捕捉相关性,后者需要建立因果关系——两者之间存在结构性错配。
50万小时:被卡住脖子的数据
大模型可以吞噬互联网上万亿级的文本和图片,但机器人没有属于自己的互联网。真实物理世界的交互数据只能依靠遥操作一帧一帧采集,成本高昂、效率低下。
截至2026年初,全球合规、可用的真实物理交互数据总量仅约50万小时。正是数据上的巨大缺口,叠加底层架构的错配,最终催生了行业对预训练目标和技术路线的重新审视。
三类玩家,没人敢只押一条路
当"大脑"成为决胜点,玩家大致归为三类。
第一类是海外大模型公司,试图打造跨本体、跨任务的通用大脑。Skild AI聚焦通用世界模型研发,核心能力是让机器人在真实物理环境中实现零样本任务泛化。
Physical Intelligence走VLA路线,靠海量真机数据在跨本体泛化上建立壁垒。它们的共同特征是押注"一个模型通吃"的通用路线。
第二类是科技巨头,做机器人时代的基础设施。英伟达推出Isaac GR00T,定位面向通用人形机器人的开放参考平台。Google DeepMind发布Gemini Robotics,依托多模态大模型的理解能力,试图用互联网知识补足机器人常识。
华为选择不做本体,推出CloudRobo具身智能开发平台,定位一站式公共开发工具链。三家巨头的共同选择是不造机器人硬件,只提供"大脑"层能力。
第三类是国内公司,路径更加多元。逐际动力提出"模型只是技能,系统才是真大脑",发布具身大脑系统LimX COSA 0.5,把认知、技能和运控拆成三层——等于把通常端到端的模型拆成了可独立优化的模块。
自变量机器人走端到端路线,其WALL-A模型采用端到端VLA操作大模型架构,与世界模型深度融合,实现具身多模态思维链。
蚂蚁灵波拒绝"借脑":从零设计物理原生大脑
在众多玩家中,蚂蚁灵波的路线最为激进。作为蚂蚁集团面向具身智能与机器人产业设立的核心业务载体,,构成"全栈大脑2.0"体系,并在一周内密集开源。
其中,LingBot-VA 2.0被定义为行业首个"具身原生"世界动作模型。具身原生的核心主张很明确:拒绝把通用大模型当作现成的脑袋接上一具身体,而是从物理世界的运行规律出发,重新设计感知、推演和执行三个环节的底层逻辑。
蚂蚁灵波首席科学家沈宇军坦承,VLA是当前更容易落地的主流路线,VA/WAM补上了动态建模和未来预测。但他同时表示,未来不会是"VA或者VLA的天下",一定会出现一个"1+1>2"的新模型。
落地场景方面,蚂蚁灵波与乐聚合作,将VLA 2.0部署到物流分拣产线。与国大药房合作落地人机协同药房方案,机器人在超过150种药品中识别目标、抓取并送回,单次任务平均不到3分钟。与奥比中光合作,将视觉感知能力与深度相机硬件结合。
目前LingBot-VLA 2.0已适配17家厂商、20余种构型,单臂、双臂、双足和轮式全覆盖。乐聚作为核心数据伙伴,为模型提供了近万小时高质量多模态真机数据。
量子位统计显示,LingBot-VLA 2.0的预训练用了6万小时高质量物理数据:5万小时真机数据从9万小时原始数据中清洗出来,另外1万小时从2万小时第一视角人类操作视频中提炼。
LingBot-VA 2.0在仿真基准测试中把单步推理延迟压到了6.7毫秒。作为对照,LingBot-VLA 2.0在RTX 4090上的单次推理延迟约为130毫秒。
VLA吃掉42%的钱,VA正在后面追
大脑赛道内部的分化同样剧烈。VLA路线以42%的资金占比成为绝对主力,它的优势很直观:继承视觉语言模型的语义理解能力,把观察、语言和动作直接连接,成熟、直接、离落地更近。
VA路线正在获得越来越多的关注。它将视频预测和世界模型引入机器人控制,把未来场景演化作为动作生成的一部分——机器人不只是看到什么就做什么,而是先在"脑子里"预演动作的后果,再挑最优方案执行。
两条路线各有拥趸。但蓝鲸新闻引述的沈宇军判断指向了另一种可能:未来的赢家不是VA或VLA中的某一个,而是能把两条线能力融到一起的"1+1>2"的新模型。
15亿首轮融资,灵波站到了考场中央
蚂蚁灵波已确认启动首轮独立融资,拟募资15亿元,目标在年底完成二轮融资。,将持续聚焦通用机器人大脑,加大对具身原生技术路线的投入,加速产业落地。
这笔融资若如期完成,投后估值可能迈入独角兽门槛。在海外,Physical Intelligence今年3月传出洽谈新一轮融资,估值目标超110亿美元。Skild AI今年1月完成约14亿美元融资,估值超140亿美元,距离上一轮仅7个月,估值翻了三倍。大脑层的估值正在以远超传统硬件的速度膨胀。
智元联合创始人、总裁兼首席技术官彭志辉在WAIC 2026上提醒:"目前,行业对具身大脑的技术路径尚未收敛,两三年可能就会出现新架构,很难预判技术的唯一答案。"
一台人形机器人的硬件采购成本动辄数十万元,绝大多数服务场景难以在合理周期内收回投入。
换一种身体就要重新训练一套模型,换一个场景就要重新部署一次——这种碎片化开发是具身智能规模化落地最大的隐性成本。各家要么有脑无身、有身无脑,真正具备跨本体适配能力的玩家屈指可数。
方向已经清晰,剩下的只是谁先走通
蓝鲸新闻的报告没有给出单一结论,但它呈现的资本流向本身就是一种集体判断。大脑派公司融资222.53亿元,本体派仅56亿元——资本在说,瓶颈不在身体上。
过去两年,行业的兴奋点集中在"能不能做出来"。接下来的五年,真正的考验是"能不能用起来"。大脑派公司吃到了一半以上的融资,但35家公司中20家还停在Pre-A轮之前。资金进来了,产品还没有规模化验证。
接下来的竞争,不再是比谁先发模型。数据从哪里来、模型如何在不同本体和场景之间低成本迁移、开源生态能不能形成正向循环——这些才是真正卡住产业化的问题。资本已经完成了投票,赛道上的选手还在跑。