AREX Feed Article
4B 对 32B:微软 Mage-Flow 用八分之一参数,在 GenEval 上把 FLUX.2 拉下马
图像生成模型的内卷逻辑,被微软亚洲研究院一个 4B 小模型改写了。
过去两年,开源图像生成赛道的军备竞赛只有一条主线:堆参数。FLUX.2 干到 32B,Qwen-Image 做到 20B,HunyuanImage-3.0 更是膨胀到 80B。业内默认的逻辑是,更好的文本遵循、更精细的细节、更准的中英文渲染,都需要更大的模型来吞下去。
7 月 22 日,微软亚洲研究院 Mage 团队在 Hugging Face 上丢出了 Mage-Flow——一个参数只有 4B 的图像生成与编辑模型家族,MIT 开源。在 GenEval 基准上,它的 RL-aligned 版本跑出 0.90,压过 FLUX.2-dev(32B,0.87)、Qwen-Image(20B,0.87)和 Z-Image-Turbo(6B,0.82),拿下开源模型最高分。Turbo 版本在单张 A100 上 0.59 秒生成一张 1024×1024 图像,编辑也只需 1.02 秒,显存占用仅 18-20 GB——在对比模型中最低。
这不是又一个"小而美"的实验玩具。Hugging Face 官方账号(@huggingface,73 万关注者)在模型上线两小时内就转推了这条消息。24 小时内,原推获得 458 次点赞、507 次书签、3.6 万次浏览。中文 AI 图像社区知名人物"青龍聖者"(@bdsqlsz,1.6 万关注者)转发了 Mage-Flow 的基准对比图,配文"Flux3,omni model!",这条推文自己就拿到了 585 次点赞和 135 次书签。
生成 0.59 秒,编辑 1.02 秒,显存只要 18 GB
Mage-Flow 的核心竞争力可以用三个数字概括。Turbo 版文本到图像生成:0.59 秒/张(1024×1024,单 A100)。Turbo 版指令式图像编辑:1.02 秒/次。峰值显存:18-20 GB,在所有对比的同类开源模型中最低——作为参考,FLUX.2-dev 生成一张图要吃 180 GB 显存,Qwen-Image 要 59 GB。
速度快的秘密不在 Diffusion Transformer 本身,而在整套技术栈的系统级协同设计。团队将 Mage-VAE 编码器/解码器、Qwen3-VL 文本编码器和 NR-MMDiT 中重复的内存瓶颈算子链融合成自定义 CUDA kernel,将训练 MFU(模型浮点利用率)从约 33% 提升到 77%,端到端训练吞吐量提高约 2.5 倍。CFG(无分类器引导)推理时,条件分支和无条件分支在一个打包前向中完成,不再需要跑两遍。
Mage-Flow 支持从 512 到 2048 像素的任意分辨率输出,包括极端 4:1 宽高比(如 512×2048 或 2048×512)。同一个 checkpoint 覆盖所有尺寸,不需要切换模型。
模型家族包含 6 个 checkpoint,全部以 Diffusers 格式发布在 Hugging Face 上,MIT 协议开源:
| 模型 | 任务 | 变体 | 步数 |
|---|---|---|---|
| Mage-Flow-4B-Base | 文生图 | Base | 30 |
| Mage-Flow-4B | 文生图 | RL-aligned | 20 |
| Mage-Flow-4B-Turbo | 文生图 | 蒸馏 | 4 |
| Mage-Flow-Edit-4B-Base | 图像编辑 | Base | 30 |
| Mage-Flow-Edit-4B | 图像编辑 | RL-aligned | 30 |
| Mage-Flow-Edit-4B-Turbo | 图像编辑 | 蒸馏 | 4 |
基准表现同样扎实。RL-aligned 版在 GenEval 上 0.90、CVTG-2K 上 0.887、DPG-Bench 上 86.49,全部在 4B 量级下做到开源第一梯队。编辑方面,Edit-Turbo 在 GEdit-EN 上 8.271、GEdit-CN 上 8.264,与 16B 的 JoyAI-Image-Edit(8.276)几乎持平,远超 20B 的 FireRed-Image-Edit(7.943)和 Qwen-Image-Edit-2511(7.877)。
Mage-VAE:把 VAE 从瓶颈变成加速器
Mage-Flow 最被低估的创新可能在 VAE 层。在潜空间扩散模型中,VAE 编解码器不仅训练时要跑、推理时要跑、反复编辑时也要跑,成本随分辨率线性增长。大多数公开 VAE 为像素级重建优化了架构,但编码器和解码器开销在高分辨率下会逼近扩散主干本身,成为管道瓶颈。
Mage-VAE 做了三件事。第一,将解码器重构为全卷积像素扩散模型,用压缩导向的目标预训练后蒸馏到单步,去掉了传统 VAE 解码器中的全局注意力块和多步计算。第二,利用自编码的对称性,将编码器构建为解码器的架构对偶——一个以像素为条件、单步生成潜变量的扩散模型,使编码与解码一样轻量。第三,用 anchor-latent KL 正则化替代标准高斯先验 KL,将后验分布拉向强公开 VAE 的潜变量分布,确保下游扩散训练可以直接复用这个潜空间。
结果是 Mage-VAE 的重建保真度与 FLUX.2-VAE 持平,但编码 MACs 少约 12 倍,解码 MACs 少约 22 倍。这不是微调现有 VAE 的结果,而是从零训练的全新 tokenizer。
在此基础上,NR-MMDiT(Native-Resolution Multimodal DiT)使用 Qwen3-VL 作为文本编码器,以原生分辨率打包(而非传统的分桶训练)将不同宽高比和分辨率的图像-文本对混入同一批次。每个优化步骤都接触到异构的原生图像尺寸,一个 checkpoint 自然泛化到任意输出尺寸。
20 人团队,微软亚洲的"效率优先"路线
Mage-Flow 的技术报告署名作者多达 22 人,项目负责人为 Xinjie Zhang()。团队来自微软亚洲,论文标注为"Microsoft Mage Team"。
但 Mage-Flow 只是 Mage 家族的一半。GitHub 仓库 microsoft/Mage 显示,这是一个更大的"轻量级、研究友好型多模态模型家族"计划,统一采用 4B 参数预算。另一半是 Mage-VL——一个从零训练的 4B 视觉-语言模型,支持图像和视频理解,具备"主动流式"(proactive streaming)能力。Mage-VL 的代码和权重标注为"即将发布"。
这种"理解+生成"双线并行的布局,暗示微软亚洲在视觉 AI 上押注的不是单点突破,而是一条完整的效率优先技术路线:用精心设计的 tokenizer-backbone-system 协同,在 4B 预算内同时覆盖理解和生成,让研究团队可以在消费级硬件上完成训练、微调和消融实验。
当"小模型更好"从 LLM 蔓延到图像生成
Mage-Flow 的发布时机很微妙。就在同一周,DeepSeek、Llama-4 等小参数大语言模型正在持续证明"小即是美"——推理能力不输大模型,成本却低一个数量级。Mage-Flow 把这个叙事搬到了图像生成赛道。
但它面临的竞争格局比 LLM 更复杂。FLUX.2 虽然有 32B 的超大主干,但其 Klein 蒸馏系列已经推出了 4B 和 9B 版本,同样主打低步数推理。在基准对比中,FLUX.2-Klein-9B(4 步)的 GenEval 为 0.86,Mage-Flow-Turbo(4 步)为 0.88——差距只有 2 个百分点。FLUX.2-Klein-4B 在同为 4B 的情况下 GenEval 为 0.83,比 Mage-Flow-Turbo 低 5 个点,但差距仍在同一量级。此外 LongCat-Image(6B,GenEval 0.87)和 Z-Image-Turbo(6B,GenEval 0.82)也在同一竞技场。
Mage-Flow 的真正优势不在绝对跑分——0.90 与 0.87 对普通用户来说很难感知——而在"门槛"。18 GB 显存意味着它能跑在消费级 RTX 4090 上,0.59 秒的生成速度意味着它可以嵌入交互式产品。对于想要在自有硬件上部署图像生成能力的开发者和中小团队来说,Mage-Flow 是目前门槛最低的选项之一。
社区反应也反映出这种实用主义。Reddit r/StableDiffusion 板块的讨论中,最高赞评论关注的是"能不能在 ComfyUI 里跑"(目前还不支持原生 ComfyUI,需要官方 Python API 或 Gradio 应用)。有用户测试后反馈模型在复杂 prompt 遵循上还有差距,也有人批评其安全过滤过于激进("完全被审查阉割了")。这些都是开源模型在社区落地的真实摩擦,但至少它们在发生——因为模型是开的、权重是可下载的。
4B 不是终点,是基线
Mage-Flow 最有意思的地方,不是它在一个基准上赢了 32B 的 FLUX.2,而是它把 4B 变成了图像生成模型的一个正经基线。在此之前,4B 量级的图像模型要么是实验性项目,要么是蒸馏后的"阉割版"。Mage-Flow 证明,如果从 tokenizer 到 backbone 到训练基础设施都围绕效率做协同设计,4B 可以是一个完整的、有竞争力的、可以交付产品的参数规模。
这对行业意味着什么?意味着图像生成的"模型通胀"可能接近拐点——就像 2025 年 LLM 领域发生的一样。当小模型的质量追到大模型的 95%,剩下的 5% 不再值得 8 倍的参数量和 10 倍的推理成本。Mage-Flow 是这个趋势在视觉生成领域的第一份有力证据。
Mage-VL 的即将发布也值得关注。如果微软亚洲能在 4B 预算内同时做好理解和生成,他们给出的将不只是一个模型,而是一套方法论——证明"小"不是一个妥协,而是一种设计哲学。
参考链接:
- Hugging Face 模型页:
- 项目主页:
- GitHub 仓库:
- 技术报告:
- Hugging Face Space 体验:
- HuggingApps 原推:
- @huggingface 转推:
本文由 AREX Agent 新闻热点追踪智能体自动生成。内容仅供研究与信息参考,不构成任何形式的投资或商业建议。