AREX Feed Article
智谱发布 GLM-5.3:743B 基座不动,纯后训练换来 Coding 与网安开源 SOTA
北京时间 8 月 14 日 13:17,智谱(Z.ai)官方账号 宣布 GLM-5.3 发布,把卖点写成一句 "Built to Code. Ready for Cyber Defense.":顶级 Coding 与 Agent 能力,加上官方所称开源模型中的网络安全新标准。最硬的一个事实是,743B 基座与 GLM-5.2 完全相同,开篇第一句就是 "Scaling post-training is all we did for GLM-5.3"(GLM-5.3 只做了后训练扩展)。
官方博客公布的自评数字跳得厉害:Terminal-Bench 3.0 从 4.6 冲到 28.3,ExploitBench 从 24.4 翻到 54.4,CyberGym 以 84.5 排在对比表全场第一。但"开源"要打个时间差:权重将在发布两周后、完成安全评估与加固后放出。截至北京时间 16:20 左右,官宣推文已有约 102 万次浏览、9600 余次点赞、1200 余次转发、1000 余次引用。
743B 基座没动,ExploitBench 先翻了一倍
博客给 GLM-5.3 的定义是 "the most capable open-weights model for coding"(最强的开源权重编程模型):在内部评测 Z.ai Code Bench 上比 GLM-5.2 提升 50%,在 Terminal Bench 3.0 和 Agents' Last Exam 等公开榜单上自称开源 SOTA。Code Bench 的细节对比:Max 档 34.5% 精度、平均约 75K 输出 token,前代是 23.4% 精度、96K token;High 档 31.4%、约 50K token,超过 Claude Opus 4.8 的 29.5% 与 120K token,而 Claude Fable 5 在 Max 档仍是更高的 39.5%。
公开榜单同样翻倍式上涨:DeepSWE v1.1 从 46.2 到 66.9,Agents' Last Exam 从 23.8 到 28.5,PostTrainBench 从 31.7 到 39.8。网络安全三件套里,CyberGym 84.5 比 GLM-5.2 的 77.2 高 7.3 个百分点,压过 Mythos 5 的 83.8 和 GPT-5.6 Sol 的 83.6;ExploitBench 54.4,是前代 24.4 的两倍多;ExploitGym 两小时解出 105 题、六小时 130 题,前代只有 29 和 39。
智谱已经把 GLM-5.3 列为"旗舰模型",标注"编程开源 SOTA 能力""涌现的网络安全能力",1M 上下文、128K 最大输出,一句话定位是"编程与智能体能力比肩 Claude Fable 5"。
发布当天就能用。,GLM-5.3 现可通过 GLM Coding Plan 与 ZCode 使用,API 与开源权重将在严格安全评估后"分阶段"放出;宣布当日向全部用户推送,Coding Plan 用户的 5 小时与周配额清零,免费档无需订阅即可试用;开源编程 agent 在 14:19 跟进:"GLM-5.3 now available in Go"(GLM-5.3 已可在 Go 中使用),纯文本、1M 上下文、与 5.2 同价。
权重还没放,Ollama 已经排上队
清华大学教授唐杰(@jietang)在官宣 11 分钟后发推:(GLM-5.3 来了,重点是 coding。)(Tech Buzz China 编辑)随后公开祝贺 "the Zai team @jietang @ZixuanLi_"。
在 13:20 补了一组数字:"GLM-5.3 uses the same 743B base model as GLM-5.2, while matching the performance of models several times its size."(沿用与 GLM-5.2 相同的 743B 基座,追平数倍体量模型的性能。)并列出 Terminal Bench 3.0 28.3、DeepSWE 66.9、Agents' Last Exam 28.5、GDPVal-AA 1769。
生态一侧,在 14:37 表态:"Ollama will support GLM-5.3 upon the open release!"(权重开源当天,Ollama 就会支持。)另一边的评论不这么温和,科技分析师、getSuperintel 主编 转发全部涨幅数字后补了一句:"After this release, I unfortunately expect the US government to regulate open source."(这次发布之后,我担心美国政府会出手监管开源。)
两个月一次升级,这次只扩后训练
GLM 这条线今年的节奏固定: 2 月 12 日发布, 4 月 7 日发布, 6 月 16 日以 MIT 许可开源,承诺"无地区限制、技术访问无边界",1M 上下文,Terminal-Bench 2.1 从 5.1 的 63.5 提到 81.0。智谱中文文档里的定位一路爬升:GLM-5"对齐 Claude Opus 4.5",5.1"对齐 Claude Opus 4.6,可自主工作长达 8 小时",5.2"Coding 能力开源 SOTA",到 5.3 直接写"比肩 Claude Fable 5"。
5.3 与 5.2 最大的区别是没有新基座。5.2 发布时搭好的三件套继续服役:IndexShare 处理长上下文,SAO 做长程任务 RL,slime 支撑大规模异步训练。博客的说法是 "Over the past month we kept scaling on this stack"(过去一个月,我们一直在同一套栈上扩规模),多环境、多任务、多算力,全部花在后训练上。8 月 3 日已有并发推问"是不是要来了"。
网安是「涌现」的,环境工厂是引擎
"涌现"是博客自己的措辞:把漏洞发现数据与环境加入训练混合后,能力增长快于预期,模型不再只找孤立缺陷,而是跨多个利用阶段规划完整攻击链。三个评测里,越往利用链条深处走,相对 GLM-5.2 的涨幅越大:CyberGym 高 7.3 个百分点,ExploitBench 翻倍,ExploitGym 六小时解题量从 39 涨到 130。
增长的引擎是环境而非模型结构。博客介绍,任务环境必须"可执行、可验证、接近真实专业工作",为此建了一条端到端合成环境的流水线:研究 agent 从真实工作里收集任务模式,judge agent 试做一遍验证可解性,verifier 在不接触参考答案的情况下生成,再用求解轨迹封堵奖励捷径。一个 ML 基础设施任务,可能给模型工程师同款的集群、存储、文档和代码库,要求它诊断瓶颈、实现优化、跑实验、交出可量化的端到端提速。
底层框架 slime 同步升级:训练侧 Megatron、rollout 侧 SGLang,训练与 rollout 的对数概率差异压到 1e-7 量级,较此前下降 99.99% 以上,长程 coding RL 的端到端训练吞吐提升超过 2.3 倍。
这套能力有一份公开账本作为落地形态。Z.ai 称,GLM-5.2 之后与中国多家安全团队合作,在 269 个真实项目里找出 2436 个漏洞,其中 1097 个中高危;53 个已公开披露,2383 个仍在保密期内;最早的漏洞 1981 年引入,平均"存活"26.6 年。公司为此维护 Z.ai Security Disclosure Ledger,持续更新披露进度。
「开源 SOTA」的边界:权重再等两周,最深处仍落后闭源
两个事实同时成立。一方面,CyberGym 84.5 是这张表里的全场第一,压过 Mythos 5 的 83.8 与 GPT-5.6 Sol 的 83.6;另一方面,越深的环节差距越明显:ExploitBench 54.4 对 Mythos 5 的 78.0、GPT-5.6 Sol 的 76.5,ExploitGym 六小时 130 题对 247 与 293。博客自己把关系讲清楚了:"Capability is growing fastest exactly where we are furthest behind."(能力增长最快的地方,恰好是我们落后最多的地方。)
开源时间表同样没有一步到位。博客写明权重在"发布两周后"放出,前提是安全评估与加固完成;注意到了这个反常组合:"Zai really emphasizing Cyber Security in its GLM-5.3 release. I've never seen this from any Chinese AI Lab release b4."(中国 AI 实验室此前没有哪次发布像这样主打网络安全。)
两周后是下一个确定的时间节点。在那之前,GLM-5.3 的"开源"只存在于 Coding Plan 订阅、ZCode 免费档和 Z.ai 自己发布的评测表里。
参考链接
- Z.ai 官方发布推文:
- GLM-5.3 官方技术博客:
- Z.ai 关于发布渠道的回复推文:
- ZCode 官方公告推文:
- OpenCode 官方推文:
- 唐杰(@jietang)推文:
- Rui Ma 推文:
- Zixuan Li 推文:
- Ollama 官方推文:
- Chubby(@kimmonismus)推文:
- tphuang 推文:
- 网友在 ZCode 官网发现 GLM-5.3 字样的推文:
- 智谱 AI 开放平台模型概览:
- GLM-5 官方博客:
- GLM-5.1 官方博客:
- GLM-5.2 官方博客: