AREX Feed Article
FaceMind 凭循环世界模型登顶 Hugging Face,字节三倍预算仍落后 Genie 10%
2026 年 6 月 16 日,一篇题为《Looped World Models》的 arXiv 预印本爬上了 Hugging Face 每日趋势榜榜首。作者署名 31 人,全部来自一家上海初创公司 FaceMind(脸谱心智),团队总共约 20 人,大部分二十出头。
两周后,这家公司宣布完成数千万元 Pre-A 轮融资,由星连资本领投,老股东奇虎 360 超额跟投。创始人陆弘远,95 后,港中文博士,此时距离他 2023 年创立公司不过三年。
360 说「一次投资终生学习」,字节说「我们落后 10%」
360 集团投前负责人向其奇在融资公告中称陆弘远是「我见过最顶尖的年轻 AI 研究者之一」。他说自己每次沟通前都要先读 FaceMind 最新论文和技术报告,「真正体会到了什么叫做一次投资,终生学习」。
早在 2025 年 6 月,360 就已通过工商变更持有 FaceMind 约 6% 股权,彼时公司还挂着大语言模型的标签。从 LLM 到世界模型的转型完成之后,360 选择超额追加投资。
星连资本合伙人李文珏看重的是团队「兼具扎实的研究能力和复杂工程落地能力」,称其能够「快速将研究成果放入真实场景中验证」。
字节跳动内部则呈现另一幅图景。2026 年 6 月初,字节 Seed 团队负责人吴永辉在全员会上将世界模型列为公司年度最高 AI 优先级,排在 Seedance 视频模型、编程智能体和豆包商业化之前。字节为世界模型训练数据拨出的预算高达数千万元,据一位数据供应商称,这个数字是其他厂商的三到四倍。
然而内部基准测试的结果并不好看。两位接近 Seed 团队的人士分别透露,截至 2026 年初,字节世界模型的整体表现仍落后全球 SOTA 约 10%,以 Google 于 2025 年 8 月发布的 Genie 3 为参照。吴永辉多次在内部表示,字节的世界模型和具身智能「表现不及预期」。
字节把世界模型提上最高优先级那天,一场效率竞赛已经开场
2026 年 6 月初,字节跳动在内部确立了四大 AI 方向:世界模型、Seedance 视频模型、编程基础和豆包商业化。其中世界模型获得了最高的数据预算,覆盖 VLA、长视频和 3D 等多模态数据,金额达八位数人民币。
字节入场并不早。2024 年从阿里加入的周畅才开始主导世界模型研究,彼时内部判断是路线和商业场景都不清晰。2025 年才组建了一支小型团队探索 VLA 路线。到 2026 年春节后,Seed 新设了由前 Meta FAIR 研究员樊昊祺领导的世界模型研究组,两条 VLA 路线合并,统一向周畅汇报。
阿里、腾讯、华为同样在推进各自的世界模型路线,但字节用预算标定了这条赛道的优先级。它公开承认落后的事实,解释了为什么一篇 20 人团队的论文能在十天内促使老股东 360 超额追加投资、新股东星连资本领投数千万。
更大的背景在具身智能。Crunchbase 数据显示,截至 2026 年 5 月中旬,中国机器人初创公司当年已融资 56 亿美元、覆盖 176 笔交易,追平了 2021 年全年的历史峰值。世界模型是这些机器人理解环境、预测行动后果的底层引擎。
赛道同时在快速拥挤。2026 年前七个月,中国新成立了 23 家世界模型初创公司,超过了 2025 年全年(20 家)的总量,其中 18 家已完成早期融资,投资方包括红杉中国、高瓴、腾讯和小米。阿里千问大模型前负责人林俊阳 2026 年 5 月离职创办的宇用科技,种子轮估值已达约 20 亿美元。
同一组参数反复迭代 15 次:100 倍效率是怎么算出来的
LoopWM 的核心做法:用一个参数共享的 Transformer 模块反复迭代隐空间中的环境状态,而非堆叠几十层不同的参数。简单场景迭代 3 次即可收敛,复杂场景自动增加到 15 到 20 次。
这套架构声称参数效率可达传统设计的 100 倍。FaceMind 论文中将关键机制拆为三个层次:
第一,Compounding Error 的控制。传统世界模型在多步 Rollout 中,每步预测误差会被系统雅可比矩阵指数放大。DreamerV3 通常只敢想象 15 步,50 步后彻底崩溃。
LoopWM 通过对模型雅可比矩阵施加谱半径约束(ρ < 1),把每轮循环迭代变为压缩映射,使误差随迭代指数衰减而非放大。论文称这为 100 到 200 步的长程规划提供了稳定性保证。
第二,自适应推理计算。模型根据收敛检测自动控制循环次数,简单场景少迭代,复杂场景多迭代。FaceMind 在论文中展示了一条专属于循环架构的推理扩展律:预测质量与循环次数之间呈幂律关系。
第三,Deferred Decoding。LoopWM-DD 变体将 Rollout 分成内外两层循环:内层在单步内迭代精炼隐状态,外层跨时间步做 Action-Conditioned 状态转移,连续走 K 步全程不调解码器,只在第 K 步终点解码一次。这大幅降低了长程 Rollout 过程中的解码开销。
FaceMind 已在仿真具身环境、GUI Agent 环境和真机机械臂环境中完成验证。公司计划 2026 年发布一个 10B 量级的 Looped World Action Model。
当 23 家新公司杀进世界模型,效率路线能跑赢规模吗
过去两年,世界模型的前沿由 Google DeepMind(Genie 系列)、OpenAI(Sora)和一批美国初创把持。中国团队要么依靠开源模型微调,要么沿袭 Transformer 堆深度的老路追赶。
2026 年的转折出现在架构层面。FaceMind 用一篇 arXiv 论文显示,循环共享架构可以在参数效率上打出一个数量级的优势。这对承受芯片出口管制的中国 AI 行业而言不只是学术突破,它提供了一条不依赖更多高端硅的竞争路线。
字节的处境反过来印证了这一点。它拥有中国最大的数据预算和算力储备,却在世界模型基准测试上仍然落后 10%。堆数据可以打赢视频生成:Seedance 2.0 依靠海量训练数据和 2000 人审核团队拿下 SOTA。但堆到世界模型这个领域,效率短板开始暴露。
赛道在膨胀,也在分化。新成立的 23 家公司分布在五条技术路线上:通用世界模型基座、4D 时空重建、因果推理引擎、科学发现中枢、物流仓储世界动作模型。创始人背景从北大 22 岁本科生、清华副教授、阿里千问核心成员到前菜鸟 CTO。
在 7 月 1 日的腾讯新闻专访中,陆弘远给出了自己的判断:五年后,中国可能只剩下不到六家世界模型公司,每家都有一个更专注的领域。FaceMind 的赌注是,胜出的不是花钱最多的那家,而是架构效率最高的那家。
一篇 arXiv 论文撬动一轮融资,但牌桌上的座位还没焊死
FaceMind 当前的估值已达数亿美元,新一轮融资正在推进中。陆弘远在专访中说,团队的优势之一是「股权还有稀释的空间,可以再多拿几轮」。一家没有公布任何产品收入的 Pre-A 公司,凭一篇论文和一套架构就撑起了数亿估值。这是 2026 年中国世界模型赛道给出的定价逻辑。
但 23 家公司齐头涌入意味着,FaceMind 的窗口不会一直敞开。当几大平台公司——字节、腾讯、阿里、小米——开始从几十个并行赌注中挑选赢家而非全部押注,赛道会迅速收窄。FaceMind 要么成为被选中的那个,要么被更大的实验室吸收,成为免费 R&D。
下一个信号节点已经清晰:2026 年底,字节计划发布至少一个世界模型版本,目标是追平 Genie 3。一个 20 人团队的架构创新能跑多快,一个巨头能用三倍预算追多少,这两个数字将在年底第一次对账。