AREX Feed Article
腾讯混元3D掏出WorldClaw:一句话生成可编辑3D世界,Blender直出
8 月 6 日,腾讯混元3D 团队在 arXiv 上扔出一篇论文,同步上线了项目页面和 11 个完整 3D 世界的演示。系统叫 WorldClaw:输入一句自然语言描述,输出一个在 Blender 中可直接打开、每个物件都能独立编辑的完整 3D 场景。
三天后,3D AI 领域博主 Stefan Vaskevich 在 X 上发了一段视频总结,,评论区从「Holy shit」刷到「源码在哪」。
此前,AI 3D 生成的主流叙事是一个模型吐出一个资产:一把椅子、一棵树、一只怪。WorldClaw 把这个粒度从「单个物件」直接拉到了「整个世界的布局与构成」。论文的 arXiv 编号是 ,四位作者 Chunchao Guo、Jinpeng Li、Yang Li 和 Zilong Huang 全部来自腾讯混元3D 团队。展示了 11 个示例场景,覆盖雪村、海岛聚落、彩绘沙丘、翡翠火山口,每个场景都提供了等距布局图、环绕轨道渲染和地面行走视角。
刷屏的惊叹,和一句「源码在哪」
最先引爆传播的是 Stefan Vaskevich,一位常驻曼谷的 3D AI 探索者,在 X 上有约 2900 个关注者。他在 8 月 9 日发推:
「It finally happened: instead of a single 3D asset, AI now generates an entire 3D world full of editable assets.」
随后他逐条列出了 WorldClaw 的五项能力:区域感知的程序化地形、可独立编辑的带纹理 mesh、自动物件生成与摆放、agent 自动修正比例和地形接触、全流程在 Blender 中完成。他同时也补了一句:「Still very early and far from perfect, but this is a significant step.」
,一位 Brighton 开发者,在回复中戳了一个关键问题:「The word 'source' and a github link is misleading. For clarification that is not a link to the source code — which doesn't appear to have been released.」论文和项目页都公开了,但代码没有开源。
另一位应用 AI 研究者 从评估角度提了一个更尖锐的问题:可编辑世界比一次性资产更有价值,因为 agent 可以用「人工修正成本」来衡量,而不只是视觉质量。他问:「第一遍生成之后,还剩多少人工清理工作?」这个问题目前没有答案。
还有一条评论来自 ,他关注的是工程落地:「早,但有戏。想看看生成的 mesh 在手动编辑和导出 Unity/Unreal 时能撑住多少。」
混元3D两年进化:从单品到整张地图
腾讯混元3D 不是突然冒出来的玩家。
2025 年 1 月,团队发布 ,一个大规模 3D 合成系统,主打高分辨率带纹理的 3D 资产生成。此后不到一年间,陆续开源了 Hunyuan3D 2.1 和 2.5,逐步从单资产生成扩展到场景级能力。2025 年 9 月,腾讯上线了 Hunyuan3D 3.0 平台,把 3D 模型生成包装成一站式服务。
这条产品线上,此前的每一步都在解决「做一个高质量的 3D 东西」。WorldClaw 是第一次把问题重新定义为「做一个世界」。论文在 Related Work 中把现有方法分成四类:程序化生成(PCG)、图像/视频升维、原生 3D 扩散模型、多模态 LLM agent 方法。然后逐一指出瓶颈:PCG 受限于规则表达力,视频升维缺乏全局一致性,3D 扩散模型受限于场景数据集稀缺,LLM agent 则缺乏精确的 3D 空间控制。WorldClaw 的设计回答了一个核心判断:一个全局一致的世界不需要同时在每一处都精细生成。先把骨架搭好,再在需要的地方填血肉。
粗到细的三段 Agent 接力
WorldClaw 的管线分三步,由专门的 agent 执行,agent 之间通过结构化中间表示通信。
第一步,意图解析与规划。Intent analysis agent 只提取提示中明确陈述的约束,不自行脑补。Scene planning agent 接着补齐下游模块需要的属性,输出场景规格书:区域划分、地形类型、物件类别、材质和空间关系。
第二步,全局地形生成。系统先生成一张语义布局图(color-coded 2D 地形分区),再用区域感知高度场公式混合不同地形。软区域权重将每个区域的基础高程与多频噪声及地貌算子(山峰、沙丘、台地、侵蚀)融合,使不同地形在交界处连续过渡而不断裂。随后进入渲染-检查-编辑闭环,agent 修正区域过渡和材质比例。
第三步,区域物件生成与摆放。Regional planning agent 只选地形能支撑的区域进行细化。对每块区域,渲染局部地形图后用图像编辑模型填充物件,再经 image-to-3D 模型重建为独立带纹理 mesh。3D 位置通过射线反算恢复,refine agent 循环检查姿态、质量和地形接触,任何碰撞或悬浮都会被修正,每次修正后重新渲染再检查。
论文展示的 11 个世界覆盖多种生态:雪线村、彩绘沙丘、海岛聚落、大峡谷、余烬火山口、边境矿场等。每个附带四通道渲染:外观、实例遮罩、表面法线和深度。
「生成」的边界被重新划定了
过去两年,3D AI 的叙事围绕着「做得更像、做得更快」打转:benchmark 上的 FID 分数、纹理分辨率、单次生成耗时。这些指标衡量的是一个 3D 生成模型作为「资产工厂」的能力。
WorldClaw 不再把输出定义为一个资产,而是一个由可编辑资产组成的空间。论文 Conclusion 写道:每个世界最终解析为显式地形加独立可管理的带纹理 mesh,支持自由视角探索、物件级编辑与复用,以及直接移交渲染、动画制作和游戏引擎工作流。这是把 3D 生成从「渲染管线的一环」变成了「世界构建的起点」。
距离实用还有好几道坎。论文自己列了两条未来方向。一是 code-native 3D modeling:当前生成式 3D 主干几乎无法还原显式的部件层级、参数化结构或交互逻辑,WorldClaw 已能在 Blender 中以可执行节点图编写地形材质,下一步是把这种能力扩展到物件生成。二是生产引擎集成:Blender 提供脚本化的几何和渲染访问,但大型游戏世界还需要运行时程序化生成、导航、物理和交互。换句话说,目前产出的是生产起点,不是成品地图。
世界有了,游戏还远
WorldClaw 最诚实的一句话藏在论文的 Outlook 中:「随着 agent 接手资产搜索、材质图和 shader 工作,3D 内容创作的中心问题不再是『如何构建每一个底层组件』,而是『创作者想表达一个怎样的世界』。」
这句话既是路线图,也是当前的天花板。WorldClaw 证明了从一句话到一个可编辑 3D 世界的技术通路已经走通。但通路走通和能干活之间,隔着开源代码、引擎集成和可复现的编辑成本数据。这三样东西,目前一个都没有。