AREX Feed Article
不碰 DiT,只换分词器:MiniMax 海螺开源 VTP,生成质量拉升 65.8%
8 月 10 日,Leanna Ren 在 X 上发帖: 她在 X 简介中写道:「My babies since day 1: @MiniMax_AI, @Hailuo_AI」。
她指的是 2025 年 12 月 16 日 (Visual Tokenizer Pre-training,视觉分词器预训练框架)。该项目同时放出了、和三款预训练模型权重,论文已被 ECCV 2026 接收。
VTP 挑战了一个行业里很多人遇到、但没人系统解释过的问题:在潜在扩散模型的两阶段架构中,扩大第一阶段视觉分词器的训练规模,并不会改善第二阶段生成器的效果——甚至可能让生成变差。VTP 的答案是:让分词器学会「理解」图像,而不只是「还原」像素。仅此一项改变,在不修改 DiT 训练配置的情况下,将下游生成质量拉升了 65.8%。
「我早就说过行业会认可」
VTP 开源几天后,:「这是第一个实证验证分词器缩放定律的工作,我们相信它的价值很快会被广泛认可。」
八个月后,Leanna Ren 的帖子印证了这个判断。帖文在一天内获得超过 150 次喜欢和 81 次书签收藏,评论区出现了「当之无愧的认可」「你当时就知道它会很棒」等回应。
VTP 的第一作者、华中科技大学博士生 Jingfeng Yao 在论文发布时用解释了核心动机:「我们探索了一个新问题:分词器是否也能具备缩放特性?VTP 证明了分词器是 scaling 的主角,提供了一条不靠扩大 DiT 就能提升生成系统的新路径。」他将 VTP 描述为「连续的缩放曲线,而不只是针对某个指标的『单点方案』。」
Yao 当时在 MiniMax 海螺团队实习,合作者包括 MiniMax 的 Yuda Song、Yucong Zhou,以及他的导师、华中科技大学教授 Xinggang Wang。
重建得越好,生成反而越差
主流 AI 生图模型——从 Stable Diffusion 到 DALL·E——底层都是两阶段架构:第一阶段,视觉分词器(通常是 VAE)将图像压缩为一组数字表示(latent);第二阶段,扩散模型在这组数字的空间里学习生成。
按照直觉,第一阶段压缩得越好,第二阶段生成就应该越好。但 用实验推翻了这个假设。纯重建训练的分词器,随着训练算力增加,rFID(重建质量,越低越好)从 2.0 降至 0.5——重建确实在变好。但 gFID(生成质量,越低越好)反而从约 55 恶化到约 58——生成在变差。
论文将这个现象命名为「预训练缩放问题」(Pre-training Scaling Problem):往分词器里砸算力、改重建,不仅换不来更好的生成,还可能在帮倒忙。
根因在于训练目标的偏差。重建任务驱赶分词器把注意力放在边缘、纹理、像素级误差等底层信息上,但生成模型真正需要的是「高层语义」——图里有什么东西、什么场景、物体之间什么关系。过度训练的分词器输出的 latent 更擅长还原像素,却更不擅长被扩散模型「读懂」。
CLIP + 自监督 + 重建三线合训
VTP 的解法直接:既然问题出在「分词器学偏了」,那就让它「学全」——一边保留重建能力,一边注入语义理解。框架的核心是三项训练目标的联合优化。
图文对比学习(CLIP):让分词器输出的 visual features 与对应文本描述的特征对齐。给模型看大量「图像 + 文字」配对,压缩后的数字表示要和文字的数字表示靠近。这让分词器在压缩时保留语义信息,知道图里「是什么」。
自监督学习(SSL):沿用 DINOv2 路线,包含两类任务。一是遮住图像的一部分让模型预测被遮住的内容,迫使理解整体结构而非记忆局部像素;二是对同一张图像做不同裁剪和变换,要求输出表示保持一致。
像素重建(REC):传统重建任务不完全丢掉,但权重降为 0.1(理解任务权重为 1.0)。论文发现这个配比对生成效果最优。
三个目标对 batch size 的需求差异悬殊——CLIP 需要 16k 的大 batch 保证足够负样本,SSL 用 4k,重建只需 2k。VTP 的工程解法是:每个 batch 内全部样本参与 CLIP 训练,随机抽取子集用于 SSL 和重建。
架构上,VTP 全面采用 Vision Transformer(ViT)而非传统 CNN,并采用两阶段训练:预训练阶段不加 GAN Loss,聚焦 L1 Loss 和 Perceptual Loss;微调阶段冻结 backbone,仅训练 decoder 并引入 GAN 目标。
最终 VTP-Large 在 ImageNet 上达到 78.2% zero-shot 分类准确率(超过原版 CLIP 的 75.5%)、0.36 rFID 重建质量、85.7% linear probing 准确率。
生成方面,gFID 达到 2.81(对比此前改进方法 VA-VAE 的 4.29),收敛速度比 VA-VAE 快 4.1 倍,最终可扩展至 ImageNet 256×256 上的 1.11 gFID。在不修改 DiT 训练规格的前提下,仅将 VTP 预训练算力扩大 10 倍,下游生成质量改善 65.8%,而传统自编码器在 1/10 算力处就已停滞。
分词器从「压缩机」变成「表示学习模型」
VTP 最核心的贡献不是某一项 benchmark 的提升,而是首次为视觉分词器建立了缩放曲线。
传统自编码器的三条曲线——算力、参数量、数据量——全部在很小的规模就撞上天花板。训练数据从 10 万张扩到 1 亿张,gFID 仅从 58.37 微降到 56.71;模型从 20M 参数扩到 300M,gFID 卡在 57 不动。
VTP 的曲线走势完全不同:算力增加 gFID 持续下降、模型从 Small 扩到 Large 持续改善、更多数据持续带来增益。这意味着在视觉分词器阶段投入更多资源,终于能换来可预期的回报——类似于大语言模型的 scaling law,只不过这次的对象是视觉 tokenizer。
中评论:「MiniMax 的视频能力很能打,实属第一梯队,但技术上几乎不对外。而 MiniMax 这次的开源,选了视觉分词器这个方向,去尝试解决一个行业里很多人遇到过、但没人系统解释过的问题。」
在此之前,行业对视觉分词器的优化思路主要有两条:蒸馏已有基础模型(如 DINOv2)的特征注入 VAE 潜空间,或在 DiT 训练时引入表示学习正则化。两条路的天花板都受限于被蒸馏的「教师模型」能力上限。VTP 选择从零开始联合预训练,论文数据显示这条路径的上限更高。
下次优化生成模型,先看看你的分词器
VTP 论证了一个被长期忽视的方向:在两阶段生成架构里,真正的瓶颈可能不在扩散模型,而在分词器——它不该只做压缩,而该做表示学习。这个判断被 ECCV 2026 的接收所背书,也在半年间逐渐被更多研究者跟进。