AREX Feed Article
Hunyuan3D-Buffalo 1.0:腾讯混元把 3D 理解、生成、编辑塞进一个模型
一个架构,四项任务——腾讯混元 3D 统一模型上线
2026 年 8 月 3 日,腾讯混元团队向 arXiv 提交了 Hunyuan3D-Buffalo 1.0 论文,同时上线了项目页面。该模型在单一架构内同时支持 3D 理解、文本到 3D 生成、指令引导的 3D 编辑和文本驱动的部件生成。
论文指出,此前 3D 领域的理解模型、生成模型和编辑模型各自独立开发。Hunyuan3D-Buffalo 1.0 试图用一个统一框架整合这些能力。
论文报告,该模型在文本到 3D 生成的人评对比中获得了 56.6% 的综合偏好率,是对比中最强基线 Omni123(18.4%)的三倍以上。3D 编辑任务的平均 Chamfer Distance 降至 0.0091,较此前最优方法降低了 86.7%。
论文登上 HuggingFace 8 月 5 日日榜
论文提交后被 HuggingFace Daily Papers 收录于 8 月 5 日日榜。
X 平台用户青龍聖者(@bdsqlsz,1.6 万粉丝)分享了论文链接,推文获得约 7600 次浏览和 44 次点赞。
腾讯混元此次公开以学术论文与项目页面为主要载体。项目页面展示了编辑前后对比、生成资产样例和部件拆解效果的可交互 3D 预览。
2D 已经大一统,3D 为什么慢了半拍?
GPT-4o、FLUX、Qwen-Image 等模型已经把 2D 图像的理解、生成和编辑整合进了同一个系统。论文在引言中明确对标了这一趋势。
3D 的进度落后,根源不在算法而在数据。3D 资产对比 2D 图像不仅数量少了几个量级,编辑数据尤其稀缺。让模型学会"给这只恐龙加一副眼镜,别的地方别动",需要成对的编辑前后资产,而这类数据几乎不存在。
腾讯的解法是 Nano3D-v2,一个自动化编辑数据生产管线。它先用 VLM 选最佳编辑视角,再用 2D 模型在该视角执行编辑,然后通过一个专门训练的自回归模型将 2D 编辑区域映射为 3D 边界框,在体素空间内局部修改,最后用 LATTICE 和 NaTex 分别做几何和纹理的精修。论文称这套管线产出了 1200 万组编辑数据对,是整个 8700 万训练语料的关键拼图。
8700 万样本驱动,VLM + DiT 双引擎
模型的架构由两条腿支撑:Hunyuan3D-VLM 负责"看懂"3D 物体,Hunyuan3D DiT 负责"画出来"。
Hunyuan3D-VLM 是一个 3D 视觉语言模型,从点云中提取语义、结构和空间信息,能做物体描述、部件问答、3D 定位和编辑指令合成。在 UniPart-Bench 上,它的部件问答拿到 85.47 SBERT、89.06 SimCSE,物体描述拿到 72.94 SBERT、52.84 ROUGE-L,在所有对比基线中均排名第一。
Hunyuan3D DiT 基于腾讯此前的 Hunyuan3D-2.1 初始化,接收 VLM 输出的多模态条件来驱动生成。编辑和部件生成时,DiT 还会额外接收源物体的表示作为条件,以保持未编辑区域的几何结构不变。
训练语料总计约 8700 万条:2500 万理解样本、5000 万文本到 3D 配对、1200 万编辑配对。论文的消融实验表明,把文本到 3D 的训练数据从 300 万扩大到 5000 万,人评综合偏好率就从 8.4% 跃升到 57.5%,数据规模是质量的关键杠杆。
3D 编辑旧范式被改写:CD 直降 87%,F1 翻 2.4 倍
论文在 Edit3D-Bench 上对比了五种近期 3D 编辑方法,包括 ShapeLLM-Omni、Steer3D、3DEditFormer、Tailor3D 和 Omni123。
Hunyuan3D-Buffalo 1.0 的 3D-VLM 版本在添加和移除两类编辑上均大幅领先。平均 CD 从 Omni123 的 0.0684 降至 0.0091,降幅 86.7%。平均 F1 从 Steer3D 的 0.2729 提升至 0.6515,翻了 2.39 倍。
和 CLIP 条件版本对比,3D-VLM 条件版本的 CD 从 0.0158 进一步降至 0.0091,F1 从 0.6336 提升至 0.6515。论文据此指出更强的 3D 理解能力直接提升了编辑精度。
论文还给出了另一条迁移路径:更强的文本到 3D 生成能力同样改善编辑质量。作者在分析中写道,更优的生成先验让编辑后的几何体更完整、更自然。
统一不是终点,是能力互哺的起点
论文的核心发现不是某一项 benchmark 登顶,而是用实验证明了 3D 的理解、生成和编辑可以在同一个模型里相互增强:理解好了,编辑就更准;生成好了,编辑就更自然。
论文以 arXiv 预印本形式公开,项目页面提供了交互式 demo。3D 统一多模态模型的竞赛,刚刚发令。