AREX Feed Article
VLA赛道人人都在堆大模型,华科和华为的TurboVLA直接把它扔了
过去三年,VLA(Vision-Language-Action)模型的默认架构是V→L→A:视觉输入 → 大语言模型 → 动作输出。
LLM是这个链条的心脏。OpenVLA有7B参数,π₀.₅有3.4B参数,SmolVLA也有2.3B。越大越好,越重越强。
2026年7月30日,华中科技大学和华为的联合团队发布TurboVLA。0.2B参数。内部没有大语言模型。
它的架构是V+L→A:视觉和语言各自独立编码,通过双向交叉注意力直接交互,然后输出连续动作。在LIBERO基准上,97.7%平均成功率,推理延迟31.2毫秒,显存占用0.9GB。全部在一张消费级RTX 4090上完成。
作为对比,OpenVLA在同样的卡上需要约14GB显存,吞吐量只有6Hz。
0.2B参数,32Hz,不到1GB显存,而且成绩没掉
TurboVLA的核心数据值得单独列出来。
LIBERO是当前VLA领域最常用的仿真操作基准,覆盖空间泛化、物体泛化、目标泛化和长序列四个子集。TurboVLA在这四个子集上的成功率分别是99.2%、99.8%、97.4%和94.2%,平均97.7%。
对比组:OpenVLA-OFT(7.7B参数,15.7GB VRAM,112ms延迟)得分97.1%。π₀.₅(3.4B,12.8GB,93.6ms)得分96.9%。VLA-Adapter(1.5B,4.3GB,87.3ms)得分97.3%。
TurboVLA的参数是OpenVLA的约1/35,推理速度快3.6倍,显存只需要1/17。而成功率还略高。
在RoboTwin 2.0的双臂操作基准上,TurboVLA以60.2%超过π₀.₅的57.0%。
在真实机器人平台上,TurboVLA完成了同步推理的实时操控任务。论文和项目页面有实物演示视频。代码以Apache 2.0协议开源在GitHub,发布两天已有64颗星。
扔掉大模型之后,V+L→A这条路怎么走
TurboVLA的架构设计可以总结为三个选择。
第一个选择:视觉和语言各自独立编码。视觉端用DINOv3 ViT-B,语言端用BERT base uncased。两个都是成熟的小模型,不引入LLM。DINOv3提取视觉的self-supervised特征,BERT提供指令语义。两者投影到d=256的共享空间。
第二个选择:双向视觉-语言交互替代LLM居中调度。传统V→L→A里,视觉token先被"翻译"成LLM能理解的形式,与指令token混合后由LLM处理,再从hidden state中解码动作。
TurboVLA让视觉特征和指令特征通过6层双向交叉注意力直接互相"校准":视觉看指令,指令看视觉。初始化权重来自GroundingDINO的特征增强模块。这一设计借用了视觉定位模型的思路,在TurboVLA里被重新用于动作预测。
第三个选择:非自回归的动作块预测。大多数LLM-centric VLA需要逐token生成离散动作,或通过action expert一次预测一个动作。TurboVLA使用ACT-style Transformer解码器,以融合后的多模态特征和机器人状态为输入,一次前向传播输出长度为12的动作块。
论文数字:31.2毫秒策略延迟,换算为32Hz控制频率。
论文还有一个隐含但重要的论证:执行级操控不需要大语言模型。指令的作用是告诉机器人"做什么"。一旦指令被解析,执行策略只需利用视觉证据引导动作。这个过程不需要开放域语言生成或自主任务分解。BERT级别的语义理解足够覆盖执行级指令。
换句话说,LLM在VLA的执行回路里是过度设计的。
这个论证直接回应了最尖锐的质疑:扔掉LLM,泛化能力会不会崩?LIBERO的四项子测试表明,0.2B的非LLM架构保持了与7B+模型相当的语言条件泛化。
但论文没有系统性地量化开放词汇泛化的损失。AI Weekly的评论指出了这个核心风险:"[TurboVLA] also gives up the open-vocabulary generalization those systems inherit from web-scale pretraining, and the paper does not quantify that trade-off."
华科遇见华为:一支横跨学术界和产业界的10人团队
TurboVLA的作者名单上有10个人,来自两个机构。
华中科技大学方面:Hengyi Xie(谢恒义)和Chenfei Yao(姚晨飞)为共同第一作者,按姓氏字母排序。Dingkang Liang(梁定康)是项目负责人。Xiang Bai(白翔)和Han Ding(丁汉)为指导教授。Yingying Zhu(朱盈盈)和Xianjin Wu(吴先晋)也参与了研究。
华为方面:Xuanyang Xi(席轩阳)、Yiping Tang(唐一平)、Di Xu(徐迪)三人。
华科和华为的合作有其逻辑。白翔教授是计算机视觉领域资深学者,在文本检测与识别方向有长期积累。丁汉教授是机器人领域权威。华为近年来在具身智能方向持续投入,2025年曾展示基于盘古大模型的工业机器人方案。
TurboVLA的方向,把视觉定位技术(GroundingDINO风格的双向交互)跨领域用于机器人操控,正好卡在两个团队的交叉点上。项目托管在H-EmbodVis的GitHub组织下,体现了华科"具身视觉"(Embodied Vision)实验室的定位。论文发布于2026年7月30日,arXiv编号2607.27205。
同一天,Google DeepMind发布了Gemini Robotics 2
TurboVLA发布的同一天,Google DeepMind推出了Gemini Robotics 2,一套三模型体系:Gemini Robotics 2 VLA、Gemini Robotics ER 2(具身推理)和Gemini Robotics On-Device 2。
Gemini Robotics 2的博客标题是"One brain. For any robot",主打全身控制、灵巧操作和多机器人协作。该推文在X上获得3923个赞、616次转发、83.7万次浏览。
两者放在一起,路线对比鲜明。Google:更大的基座模型,更强的泛化,从桌面操作扩展到全身人形机器人。TurboVLA:更小的专用架构,极致的效率,在消费级GPU上跑实时控制。
两条路线不是互斥的。Gemini Robotics ER 2做高层推理和任务规划,TurboVLA做执行级控制,理论上可以互补。
但TurboVLA的实验结果提出了一个更尖锐的问题:如果0.2B参数的非LLM架构就能在执行层面匹配7.7B的LLM-centric模型,那LLM在VLA里的真实贡献到底是什么?
NVIDIA机器人负责人Jim Fan在2025年12月就公开说过"VLM-based VLA feels wrong",认为把动作解码器挂在VLM checkpoint上是脆弱的嫁接。TurboVLA给了这个判断一份实验证据。
TechTimes的报道给出了一个对比:OpenVLA在RTX 4090上需要约14GB显存和约6Hz吞吐量。TurboVLA用0.9GB显存跑32Hz。速度快5倍,显存仅1/16。而AMD本月早些时候推出Ryzen AI Embedded X100处理器,128GB统一内存的卖点正是为VLA推理准备的。TurboVLA暗示问题不在硬件,而在架构。
在X上,@denogrowth写道:"大多数VLA模型仍然需要数据中心GPU才能达到实时。这个模型在单张RTX 4090上跑到32Hz,不到1GB显存。造实时响应机器人的门槛降到了一张消费级GPU。"
@BuildSignals更简洁:"0.2B参数,<1GB VRAM,32Hz。他们停止把所有东西都塞进一个大语言模型,然后它就成了。"
如果大模型不是必需的,VLA赛道往哪个方向拐
TurboVLA不是一个完美的答案。LIBERO是仿真环境,桌面操作任务的复杂度远低于真实世界的全身操控。60.2%的RoboTwin 2.0成绩说明双臂协同还有很多路要走。开放词汇泛化的损失没有被量化。
但TurboVLA的价值不在于它是否替代了OpenVLA或Gemini Robotics。它的价值在于,用一个干净的实验设计,把一个被默认了三年的架构假设变成了一个可以被检验的问题:VLA是不是一定要绕着大语言模型转?
TurboVLA的回答是:在执行层面,不需要。
这个回答的影响面很具体。一个大学机器人实验室、一个硬件爱好者、一个小型创业团队,他们现有的一张RTX 4090,现在可以跑一个97.7%成功率的语言条件操控策略,而不是等着云端推理或专用芯片降价。
VLA的下一个阶段,可能不再是"更大的VLM + 更好的action head"。TurboVLA打开了另一条路:把高层推理和低层控制拆开,让各自用最适合的架构。Gemini Robotics 2已经在做这个拆分。TurboVLA证明了,做动作的那一半,可以有多轻。
参考链接:
- 论文:
- 项目页面:
- GitHub仓库:
- HuggingFace Papers:
- AI Weekly报道:
- TechTimes报道:
- Google DeepMind Gemini Robotics 2: