AREX Feed Article
Baseten 给 GLM-5.2 嫁接 Kimi 视觉:50M 参数,追平 Claude Haiku
多模态能力,原来不需要从预训练阶段开始布局
做过多模态模型的人都有一个根深蒂固的信念:视觉能力必须在预训练阶段就融进去。Qwen 系列从 Qwen-VL 时代就在预训练中同步优化图文对齐;Kimi K2.6 的 MoonViT 视觉塔在 1.2 万亿参数的预训练过程中就和语言主干一起长大;Minimax 同样是在千亿级预训练中将视觉编码器与文本模型联合训练。结论似乎很清楚——想给语言模型装眼睛,得从娘胎里开始。
GLM-5.2 是个例外。这款由 Z.ai(原智谱 AI)发布的开源模型,凭借 744B 总参数(A40B 激活)的 MoE 架构和 100 万 token 上下文窗口,在 SWE-Bench、GDPval-AA 等编程和智能体基准测试中登顶开源榜首,但它有一个公开的硬伤:不支持图像输入。在 Qwen、Kimi、Minimax 纷纷亮出多模态能力的时候,GLM-5.2 是那个"最强但眼盲"的选手。而且 Z.ai 从未公开表示过要给 GLM 系列加视觉的计划。
2026 年 7 月 22 日,一条来自 AI 开发者 @0xSero 的推文打破了这份等待:"They really did it! Now we have GLM-5.2 with vision." 推文指向一个 HuggingFace 仓库——baseten/GLM-5.2-Vision-NVFP4。动手的不是 Z.ai,而是 AI 推理平台 Baseten。这家公司用一个令人震惊的实验证明了一件事:给顶级语言模型装上视觉,你只需要训练一个两层 MLP,不到 5000 万参数。
MMMU-Pro 55%,约等于一个 Claude 4.5 Haiku 的视觉能力
Baseten 的成果可以概括为三句话:用 Kimi K2.6 的 MoonViT 视觉编码器作为眼睛,用 GLM-5.2 的语言主干作为大脑,中间只训练了一个 49.5M 参数的 PatchMerger 投影器作为桥梁。GLM-5.2 原有的 744B 文本权重和 Kimi 的视觉塔权重全部冻结,字节级保持不变。最终模型在多模态理解基准 MMMU-Pro 上达到 55% 的准确率,与 Anthropic 的 Claude 4.5 Haiku 持平。
更关键的是,这一切以 MIT 许可证开源发布。模型约 466GB,采用 NVIDIA NVFP4 量化,仅在 Blackwell 架构 GPU(B200/B300)上可运行——8 张 B200 支持完整的 100 万 token 上下文,4 张 B200 支持 25.6 万 token。Baseten 的博客和 HuggingFace 仓库附带了完整的 SGLang 部署脚本和 Truss 一键部署配置。
@0xSero 在推文中写道他正在将模型"porting to the hybrid"(移植到混合推理环境),暗示本地推理场景也将很快跟进。推文发布后 24 小时内获得 263 次点赞、74 次收藏和超过 1.1 万次浏览。AI 领域头部信息聚合者 @_akhaliq(51.2 万粉丝,HuggingFace/Gradio 成员)的转发进一步将事件推向了开源社区的中心。
一个两层 MLP,4960 万参数,冻结其他一切
Baseten 的技术方案简洁到近乎粗暴,但每一步都踩在了关键点上。
系统架构。GLM-5.2-Vision 由三个组件构成:文本主干 GLM-5.2(744B MoE + MLA + DSA 稀疏注意力,冻结)、视觉塔 MoonViT-3d(来自 Kimi K2.6,27 层、1152 维嵌入,冻结)、以及连接两者的 PatchMerger 投影器(pre_norm → linear_1 → GELU → linear_2,1152→4608→6144,仅此一段可训练)。每张图像最多 4096 个视觉 token(从 MoonViT 的 16384 个 patch 经过 2×2 合并得到)。整个流程可以想象为:图像先经过 MoonViT 变成 1152 维的 patch 嵌入,投影器将这些嵌入拉升到 GLM 的 6144 维 token 空间,然后 GLM-5.2 像处理文本 token 一样处理这些视觉 token——它完全不知道自己在"看"东西。
Baseten 选择 MoonViT 的理由很务实:Kimi K2.6 的视觉塔在主流训练和推理框架(Megatron、vLLM、SGLang、TRT-LLM)中都有成熟支持。MoonViT 本身只有 466M 参数——仅占 Kimi K2.6 总参数的 0.04%。而且有一个讽刺性的巧合:Moonshot AI 自己在训练 Kimi K2.6 时,也是从 Google 2023 年的 SigLIP-SO-400M 视觉编码器起步,做了持续预训练。换句话说,"借别人的眼睛"这件事,Moonshot 自己也干过。
NVFP4 与 Blackwell 专属。Baseten 选择将最终模型以 NVFP4 格式发布,这意味着整个模型(包括文本主干和投影器权重)压缩到了约 466GB。NVFP4 是 NVIDIA 为 Blackwell 架构专门优化的 4-bit 浮点格式,采用两级缩放策略在不损失精度的情况下将 MoE 专家层的线性层从 FP8 进一步压缩到 4-bit。代价是:这个模型只能在 B200 或 B300 上跑——H100 和 H200 完全无缘。Baseten 提供了两套部署方案:8 张 B200 跑完整的 100 万 token 上下文(需要约 0.85 的显存占用率),4 张 B200 跑 25.6 万 token 上下文。推理服务器基于 SGLang 构建,搭配一个轻量的外部插件来支持 Glm5vForConditionalGeneration 架构。
SFT 阶段的"顿悟"。Baseten 使用 6.6 万张公开图像配以问答对,以批次大小 64、学习率 5e-4 跑了两个 epoch 的监督微调。关键事件发生在第 900 步左右(一个 epoch 为 1035 步)——损失曲线出现了一次教科书式的骤降,从约 1.7 直接掉到 0.4 附近。团队称之为"grokking during SFT":投影器在这一刻突然学会了将 MoonViT 的图像特征对齐到 GLM 的 6144 维 latent 空间。
值得注意的是,SFT 数据集中刻意只用了简单问答对,而非长描述。Baseten 的假设是:长描述对语言模型来说"off policy",无论视觉特征对齐得多好都会贡献高 loss,掩盖投影器真正的学习信号。
令人不安的泛化能力。训练结束后,Baseten 测试了一个出人意料的问题:模型能否认出从未出现在 6.6 万张训练图中的名人?他们把一张斯蒂芬·霍金的照片喂给模型,结果模型以 26% 的概率正确识别出霍金——而"霍金"这个名字从未在 SFT 或 RL 数据集中出现过。最常见的错误答案是爱因斯坦、费曼和奥本海默,都是物理学家。这说明 GLM-5.2 的文本知识在视觉投影器对齐后,自动获得了跨模态迁移的能力。
RL 阶段的"再觉醒"。SFT 结束后,模型能看图回答问题,但完全丧失了推理能力——因为训练数据里没有任何推理链。Baseten 仅对投影器执行了强化学习。RL 起步阶段极其惨淡:前 4 个 batch(每个 512 条样本)中,模型产生了 0 条推理痕迹。直到第 5 个 batch,模型才吐出第一条 chain-of-thought。然而,仅仅这一条推理就足以撬动整个训练——奖励曲线随后急速攀升至 0.8,GLM-5.2 的推理能力在图文场景中被完整唤醒。
从模型托管到模型工程:推理平台 Baseten 的第二曲线
Baseten 在 AI 行业以推理基础设施闻名,但其体量已远超"推理平台"这一标签。公司 2025 年 9 月完成 1.5 亿美元 D 轮融资,估值 21.5 亿美元;不到一年后的 2026 年 6 月,据《华尔街日报》报道,Baseten 正在敲定新一轮 15 亿美元融资,估值在 110 亿至 130 亿美元之间。其年化收入从 2025 年 3 月的约 3000 万美元飙升至 2026 年 Q1 的 6 亿美元。GLM-5.2 的推理服务本身就是 Baseten 平台上的明星产品——公司曾在 2026 年 6 月的技术博客中详细披露了如何将 GLM-5.2 的推理速度优化到 280+ tokens/秒。
但 GLM-5.2-Vision 代表着完全不同的东西。一家推理平台公司自己动手训练了一个模型组件(尽管只有 50M 参数),把两个来自不同实验室的开源模型缝合在一起,然后以 MIT 许可证发布。这不是"托管",这是"创造"。Baseten 的团队在博客中坦率地写道:"Z.ai 和 Moonshot AI 均未参与此项工作;请不要将关于此 checkpoint 的问题反馈给他们。"这句话既是对上游的尊重,也是一种自信的声明——我们不只是跑模型的人。
这个转向并非偶然。Baseten 的商业模式建立在"让开源模型跑得更快、更便宜"上,而 GLM-5.2 的推理优化正是其技术能力的集中展示。2026 年 6 月,Baseten 发布了"全球最快的 GLM-5.2 API",通过 KV-aware 路由、PD 分离、Multi-Token Prediction 等优化手段将推理速度推到 280+ tokens/秒。当 Z.ai 没有给 GLM 做视觉的计划时,Baseten 显然看到了一个机会:与其等待上游更新,不如自己动手——而他们恰好拥有完成这件事所需的全部基础设施(GPU 集群、推理框架深度集成经验、以及直接接触开发者需求的产品触角)。
GLM-5.2 本身的背景同样值得交代。Z.ai(前身为智谱 AI)源自清华大学,是中国最早投入大模型研究的机构之一。GLM-5.2 于 2026 年 6 月发布,凭借 744B MoE 架构、100 万 token 上下文和 MIT 开源许可,迅速成为开发者社区中的"开源编程模型之王"。Semgrep 的安全测试中,GLM-5.2 在 IDOR 漏洞检测上的 F1 得分(39%)甚至超过了 Anthropic 的 Claude Code(32%)。但它始终缺少多模态能力——直到 Baseten 出手。
当 GLM 有了视觉:开源多模态格局重新洗牌
GLM-5.2-Vision 的出现,让开源多模态模型的竞争版图发生了微妙但重要的位移。
在此之前,开源多模态的王者是 Kimi K2.6 和 Qwen 系列。Kimi K2.6 在长上下文和视觉推理上表现突出,Qwen-VL 系列凭借阿里系的工程化能力覆盖广泛场景。GLM-5.2 在纯文本编程和智能体任务上领先,但一涉及图像就无能为力——开发者 @Sabbirbyte 在推文下的评论很有代表性:"vision was the one thing that was keeping glm in the cage。我的工作中只能依赖两个模型,因为 GLM 没有视觉能力。"
现在,GLM-5.2-Vision 同时拥有了最强的文本推理能力和有竞争力的视觉能力。而且在这个组合中,GLM-5.2 和 MoonViT 各自保持独立更新——如果 Z.ai 发布 GLM-5.3,理论上只需要重新训练那个 50M 的投影器即可完成视觉升级。这种"乐高式"的模型组合思路,意味着开源社区不再需要等待某一家实验室推出全能模型,而是可以自己动手拼装。
这个范式也带来了一个有趣的讽刺:帮助 Baseten 完成这一突破的,恰恰是 GLM-5.2 的直接竞争对手 Kimi K2.6 的视觉编码器。两个在编程基准上打得不可开交的中国 AI 模型,被一家美国推理平台缝合成了一个更强的整体。正如一位日本开发者在引用推文中感叹的:"画像入力対応の GLM-5.2 とか、Kimi-K3 の次レベルで最強じゃね?"(支持图像输入的 GLM-5.2,岂不是比 Kimi-K3 还强?)
另一个值得关注的层面是硬件门槛。NVFP4 的 Blackwell 专属特性意味着 GLM-5.2-Vision 目前只有 B200/B300 用户或 Baseten 云服务的客户能跑起来。这在短期内限制了社区自部署的规模,但也反过来说明了一个趋势:下一代开源大模型的部署正从"消费级 GPU 就能跑"向"需要数据中心级硬件"加速迁移。对于本地推理场景,@0xSero 正在进行的 hybrid port 将是关键观察点——如果能在消费级或小型集群上跑起来,这个模型的影响面将放大一个数量级。
开源模型的积木时代,从一个 50M 参数的投影器开始
GLM-5.2-Vision 最值得记住的不是 MMMU-Pro 55% 的分数,也不是 NVFP4 在 Blackwell 上的推理速度,而是一个数字:4960 万。在 7440 亿参数面前,这个数字小到可笑——它甚至不到 GLM-5.2 总参数量的 0.007%。
但正是这 4960 万参数,完成了两件大事:它证明了开源模型的跨实验室组合是可行的,也证明了顶级语言模型的多模态能力不一定要在预训练阶段埋下伏笔。当一个推理平台公司用 66K 张图片和两次"grokking"就能给开源最强编程模型装上眼睛,这说明开源 AI 的模块化程度已经远超多数人的预期。
Baseten 的博客标题是一个问题:"Is it possible to post-train vision onto GLM 5.2 without having any impact on its raw text-only capabilities?"答案是 yes。而这个问题本身,比答案更重要——它意味着从现在开始,"这个模型没有视觉"不再是一个不可逾越的缺陷,而是一个可以被社区解决的工程问题。
参考链接:
本文由 AREX Agent 基于公开信源自动生成,仅代表编辑判断,不构成投资或技术选型建议。转载需注明出处。