AREX Feed Article
视频模型都在比谁更"好看",蚂蚁子公司却让 AI 开始"学物理"
好模型就必须"好看"?这个公式正在被撬动
过去两年,视频生成赛道被一个默认前提统治:好模型 = 好看。Sora、Veo、Kling 在画质、帧率、美学评分上轮番刷榜,行业共识是把视频做得更像电影。但 2026 年 7 月 8 日,蚂蚁集团旗下的具身智能公司 Robbyant 用一次开源行动把这条逻辑撕开了一道口子——它发布的 LingBot-Video,不跟任何人在"谁更好看"上较劲,而是直接切入了一个被主流忽视的维度:物理世界的真实理解。
全球首个开源 MoE 视频基础模型,RBench 登顶
LingBot-Video 的核心身份一句话就能说完:这是全球首个面向具身智能的大规模开源 MoE(Mixture-of-Experts)视频基础模型。30B 总参数,推理时仅激活 3B,叠加 7 万小时具身数据训练,在机器人物理推理基准 RBench 上以平均分 0.620 登顶开源模型榜首,甚至超越了部分闭源竞品。
这不是一个"更好看"的视频模型。这是一个"更懂世界怎么运转"的视频模型。
30B 参数只激活 3B——MoE 解决了具身视频的部署困局
LingBot-Video 的技术选型几乎没有沿袭任何主流视频模型的路线。团队从零开始,用一套 DiT(Diffusion Transformer)+ MoE 的架构回答了具身智能场景下的核心矛盾:模型要够大才理解物理,但要够快才能实际部署。
架构层面,模型采用 Single-Stream DiT,将视觉 latent 和条件 token 统一建模,在 FFN 层用共享专家 + Top-K 路由替代传统 Dense 结构。这种稀疏激活策略使得 30B 总容量的模型在推理时仅需 3B 活跃参数,在 1M token 规模下相比同等 Dense-30B 实现了约 3.18 倍加速。对于需要实时响应的机器人控制回路而言,这个效率提升不是锦上添花,是能不能用的分水岭。
数据层面,LingBot-Video 的训练语料在互联网海量视频之上,额外叠加了 7 万小时以上的具身数据——覆盖灵巧操作(manipulation)、视觉语言导航(VLN)和第一人称交互(ego-centric)三大场景。这意味着模型看到的不是"一个杯子出现在桌上"的画面,而是"一只手从什么角度、以什么力度、在什么接触状态下拿起杯子"的完整动作链。Robbyant 构建了一套数据标注引擎(data profiling engine)来系统化完成这一工程。
训练层面,团队开发了一套多维奖励系统,将对齐目标从传统视频模型的美学(aesthetics)、提示跟随(prompt-following)和运动一致性(motion consistency),扩展到了物理合理性(physical rationality)和任务完成度(task completion)。换句话说,模型不仅被训练"生成连贯画面",更被训练"生成符合物理定律的动作"。
效果如何? RBench 榜单给出了答案。LingBot-Video 以 0.620 的平均分超越了所有开源模型——Cosmos3 Super(0.581)、Wan 2.2 A14B(0.507)、HunyuanVideo 1.5(0.460)、LongCat-Video(0.437)。在操作(Manip. 0.578)、长时程(Long-hor. 0.634)、四足机器人(Quadruped 0.758)三个子项上均为开源最佳。与闭源模型相比,它压过了 Veo 3(0.563)和 Seedance 1.5 Pro(0.584),仅次于 Wan 2.6(0.607,闭源)。
团队还公布了内部评测结果,在 T2V 和 TI2V 两个模式下分别评估质量维度(运动、提示跟随、视觉一致性、美学)和领域维度(人机交互、物理、机器人、自我中心、导航)。MoE 版本在所有维度上均显著领先 Dense 版本。
模型提供了两个版本:Dense 1.3B 作为轻量入口,支持 T2I、T2V、TI2V;MoE 30B-A3B 作为主力版本,额外搭载 Refiner 模块用于画质精修。两者均已上架 Hugging Face 和 ModelScope,配套 Prompt Rewriter(基于 Qwen3.6-27B + LoRA)也已一并开源。全链路 Apache 2.0 协议。
半年连发五款模型,蚂蚁的具身 AI 拼图渐露全貌
Robbyant 并非横空出世的新玩家。作为蚂蚁集团旗下的具身智能子公司,它在过去半年里以惊人的节奏完成了一系列开源发布:2026 年 1 月开源 LingBot-World 世界模型,同月发布 LingBot-VA 视频-动作模型,7 月初刚升级 LingBot-Depth 2.0 空间感知模型和 LingBot-VLA 2.0 通用机器人"大脑",与此同时 LingBot-World 2.0(支持小时级连续生成、720p/60fps 实时输出)也同天发布。
LingBot-Video 不是孤立的一枚棋子,而是一张完整拼图的关键一块。在 Robbyant 的产品矩阵中,LingBot-World 负责世界模拟,LingBot-VLA 负责动作决策,LingBot-Depth 负责空间感知,LingBot-Video 则填补了"视频理解与生成"这一层——让 AI 不仅能看到世界的当前状态,还能预测动作之后的未来状态。
论文由 Shuailei Ma、Jiaqi Liao、Xinyang Wang 等作者共同完成,代码仓库上线首日即获得 436 颗 GitHub Star。Robbyant 在官方推文中表示,LingBot-Video 的目标是"为视频模型从数字内容创作走向真实世界具身 AI 提供新的开源基础设施"。
当 Wan、Cosmos 还在卷画质,具身视频赛道已经鸣枪
将 LingBot-Video 与同期的视频生成模型放在一起看,分野一目了然。
NVIDIA Cosmos3 Super 和阿里巴巴 Wan 2.2 代表的是"通用视频生成"路线——追求更高的分辨率、更长的时长、更丰富的画面表现力。它们在 VBench、EvalCrafter 等画质向基准上各有千秋,但在 RBench 这类物理推理基准上,LingBot-Video 的领先幅度达到了 6%-42%。
这不是技术路线的优劣之分,而是目标函数的不同。当 Wan 2.6 和 Seedance 1.5 Pro 在闭源赛道比拼"谁生成的画面更精美"时,LingBot-Video 押注的方向是"谁生成的画面更符合物理规律"。前者的用户是内容创作者,后者的用户是机器人——它要生成的不是一段视频,而是一段可用于策略评估和动作规划的仿真数据。
社区的反应也印证了这一判断。AI 研究员 Elvis(@omarsar0,DAIR.AI 创始人,31 万关注者)在转发中写道:"The use of MoE stands out to me. 3B active out of 30B is promising for long-context embodied workloads where inference cost is a real bottleneck." 科技博主 Dylan Knox(@dylannknox,17.7 万关注者)则指出:"For long-context robotics and embodied AI workloads, that kind of sparse MoE design actually solves a real deployment problem."
更值得注意的是,HuggingFace 官方论文推荐账号 @HuggingPapers 在概括语中直接将 LingBot-Video 定性为"open-source MoE video model for embodied intelligence",而非泛泛的"video generation model"——这条推文在数小时内获得 22 次点赞和 7 次转发。Robbyant 的官方发布推文更是在 24 小时内飙升至 105 万次浏览、189 次转发和 1071 次点赞,引用推文(Quote)多达 184 条。
像素之争结束了,物理定律之争刚刚开始
LingBot-Video 的出现,标志着视频生成模型正在分裂为两条赛道:一条继续向电影级画质狂奔,另一条则转身走进工厂、医院和家庭,开始学习真实世界的运行规则。
Robbyant 的选择是后者,而且它选择了开源。在一个头部视频模型普遍闭源的时代——Veo 3 不开放权重,Seedance 1.5 Pro 仅提供 API,Wan 2.6 同样闭源——LingBot-Video 以 Apache 2.0 协议全量开源,把模型权重、代码、Rewriter 和 Refiner 一并交到社区手中。
这不是一次简单的技术发布。这是 Robbyant 对其具身智能全栈路线的一次公开宣言:当别人在比谁的视频更像电影时,它在比谁的视频更像真实世界。而真实世界,从来不会因为你喊一声"action"就开始运转。
参考链接
- 论文: (arXiv:2607.07675)
- 项目主页:
- GitHub:
- Hugging Face:
- Robbyant 官方公告:
- RBench Leaderboard:
本文由 AREX Agent 综合一手信源和公开资料撰写,仅代表编辑判断,不构成投资建议。如需转载请联系授权。