AREX Feed Article
智谱开源 GLM-5.3-Flash:Ox Alpha 真身揭晓,320B/18B 权重上线
智谱(Z.ai)8 月 26 日晚 GLM-5.3-Flash 并开源权重。这是 GLM-5 系列首个原生多模态模型:320B 总参数、18B 激活参数,MIT 许可,1M token 上下文窗口;它正是过去一周匿名登顶 OpenRouter 使用量榜首的神秘模型 Ox Alpha。
Ox Alpha 上周末匿名出现在 OpenRouter,免费使用并迅速冲上使用量榜首,身份引发社区连日猜测。8 月 26 日上午,报道智谱确认 Ox Alpha 是 GLM 系列新版本、将于当晚发布权重;当天上午也报道了同一消息。当晚博客上线,承诺兑现,悬疑落幕。
GLM-5 系列的第一个原生多模态模型
博客介绍,GLM-5.3-Flash 总参数 320B、激活参数仅 18B,视觉能力原生内置。与 GLM-4.5 系列相比,总参数相近(320B 对 355B),激活参数从 32B 砍到 18B,层数从 92 层减到 45 层。权重以 zai-org/GLM-5.3-Flash 的名称上传 ,官方称目前支持 SGLang、vLLM、TokenSpeed 等推理框架本地部署。
模型已向所有 GLM Coding Plan 用户开放,可用配额是 GLM-5.3 的 3 倍;ZCode 的 Browser Use 与 Computer Use 功能可以调用它的多模态能力,让 agent 点击并目视校验网页、操作桌面应用。
ox-alpha 的六天:23.2T token,2.3 倍于第二名
博客首次披露匿名测试的安排:发布前,智谱以 ox-alpha 的名字在 OpenCode 与 OpenRouter 上匿名测试、收集用户反馈,"迅速成为当周最热门的模型——所有这些流量都由国产 AI 芯片提供服务"。博客配图显示,8 月 20 日至 25 日,ox-alpha 在 OpenRouter 上处理了 23.2T token,是第二名 deepseek-v4-flash(9.9T)的 2.3 倍。
凤凰网科技的报道补充了匿名期的细节:Ox Alpha 免费使用,在 OpenRouter 排行榜升至首位,使用量是 DeepSeek 的两倍多,定位编程与智能体任务的推理模型,支持文本、图像和视频输入;智谱方面称其代号灵感来自近期上映的电影《牛来》。正在收购 OpenRouter 的 Stripe CEO 帕特里克·科里森(Patrick Collison)称这次秘密发布"令人印象深刻"。
身份悬疑在一天内收束。上午,彭博报道智谱确认 Ox Alpha 是 GLM 系列新版本并将于当晚发布权重;德国科技分析师 Chubby(superintel 主编)随即在 "Ox Alpha 是 zAI 的 GLM(-5.3 Flash)",当晚官方博客证实了这一版本号。彭博更新后的报道写明,这个模型"现在叫 GLM-5.3-Flash",据智谱博客称运行在国产 AI 芯片上。
DeepSWE 63.4 对 46.2,每任务 0.045 美元
性能数字来自智谱官方博客。六项编码与智能体基准中,GLM-5.3-Flash 全部超过 GLM-5.2:DeepSWE v1.1 为 63.4 对 46.2,AutomationBench v1.0.6 为 48.8 对 26.2,Terminal Bench 2.1 为 84.3 对 81.0,Toolathlon Verified 为 78.4 对 59.9,Agents' Last Exam 为 26.3 对 20.4。在智谱自有的 Z.ai Code Bench v1.0(跑在 Claude Code 2.1.207 上)上,模型在每一档推理强度下都超过 GLM-5.2,最高强度下拿到 29.0,接近 Claude Opus 4.8 的 29.5。
价格方面,博客给出的数字是:在 Artificial Analysis 智能指数 v4.1.1 上,GLM-5.3-Flash 以每任务 0.045 美元(折后价)得到 57 分,"这一智能水平此前大约需要 10 倍成本"。博客开篇的表述是:以十分之一的价格在基准与真实工作负载上超越 GLM-5.2,编码与智能体能力接近 Claude Opus 4.8。
这些数字需要按评测口径理解:博客脚注逐项列出设置,例如 HLE w/ Tools 由 GPT-5.6-luna 担任 judge、AutomationBench 采用修复了 null 类型处理问题的 v1.0.6;其中 GDPval-AA v2 由 Artificial Analysis 评测,其余为智谱自测。
Raschka 的拆解:34 层 KDA 与 11 层 MLA/DSA
权重开源后,ML/AI 研究工程师 Sebastian Raschka(@rasbt,《Build a Large Language Model From Scratch》作者)在 X 上发布了:GLM-5.3-Flash 采用 Kimi Linear 风格的 3:1 混合注意力,34 层 Kimi Delta Attention(KDA)加 11 层 MLA/DeepSeek Sparse Attention(DSA);主干是缩小版的 GLM-5.2 式稀疏 MoE,从 744B-A40B 缩到 320B-A18B;残差路径采用 DeepSeek V4 风格的 mHC(Manifold-Constrained Hyper-Connections),四条并行流;另有原生视觉编码器。他称之为"超级混合":KDA 与 MLA/DSA 都是高效注意力组件,而 Kimi 只用 KDA 加全注意力 GQA,DeepSeek V3.2 用 DSA 加全注意力 MLA。
这与官方博客的说明相互印证:混合稀疏+线性注意力是 GLM 系列首次引入,线性注意力通过状态建模捕捉局部依赖,稀疏注意力借助轻量 indexer 检索全局上下文;针对 1M token 上下文,IndexPool 用加权池化把四个 indexer key 向量压成一个。官方称相比 GLM-5.3,注意力计算量降至约三分之一,KV cache 降至约四分之一。Raschka 在推文末尾开玩笑说,这或许为买一台 256GB/512GB 内存的 Mac Studio M5 Ultra 本地跑模型找到了理由。
数万颗国产加速器与"模型优化自己"
博客披露,过去一周 Ox Alpha 的全部流量都由国产 AI 芯片集群承担:团队基于 SGLang 自建推理引擎,采用 Encode–Prefill–Decode(EPD)分离式架构,在"数万颗国产加速器"上运行;针对单芯片显存与带宽有限的特点,用 compute-for-bandwidth、communication-for-bandwidth 的思路做激进的内存优化。官方称相比同一硬件上的初始基线,端到端服务性能提升 3 倍,"硬件效率与单 token 成本达到与主流 NVIDIA GPU 相当的水平"。这是智谱的单方口径。
一个细节是,这套推理栈的开发本身有 GLM-5.3 驱动的基础设施 agent 参与:它协助工程师开发和优化 kernel、定位性能瓶颈、改进服务栈,形成"模型帮助优化服务模型自身的系统"的反馈回路。
身份讨论升温期间,智谱 GLM-5.2 项目负责人 8 月 26 日早晨在 X 上回应"刷榜"质疑:"GLM-5.2 中没有发现 reward hacking:解决问题,而不是刷榜。"这是公司人士的单方表态。博客结语称,智谱正把这套配方扩展到更大的模型,"构建它的经验已经在塑造我们的下一个前沿模型"。
对开发者来说,可立刻验证的变化已经发生:GLM Coding Plan 用户现在就能调用这个模型,权重可在 Hugging Face 直接下载。接下来值得盯的是两件事——官方基准能否被第三方复现,以及智谱预告的"更大的模型"何时发布。
参考链接
- _