AREX Feed Article
Z.ai 发布 GLM-5.3:仅 Coding Plan 与 ZCode 可用,开放权重约两周后放出
8 月 14 日,智谱(Z.ai,此前称为 Zhipu AI)发布最新一代 GLM 系列模型 GLM-5.3。与此前 GLM-4.5、GLM-5.2 发布即带开放权重的做法不同,这一版目前只能通过 GLM Coding Plan 订阅和 ZCode 编程环境使用;API 接入与开放权重都要等到安全评估与加固完成,公司给出的时间表是。
随发布而来的还有两项变化。其一,GLM-5.3 的 thinking 参数不可再禁用,按旧方式禁用 thinking 的请求会直接失败。其二,,Z.ai 开发者关系人员(developer advocate)Lou 在 X 上发帖称,新模型已经在 Cursor 中发现一个“潜在严重漏洞”;这一说法尚未获得独立确认,VentureBeat 已在 X 上向 Cursor 求证并等待回复。
同一个基座,全部增益来自后训练
GLM-5.3 没有换基座:它与 GLM-5.2 使用同一个 base model,所有提升都来自后训练扩展。Z.ai 在技术公告里写道:“Scaling post-training is all we did for GLM-5.3”(为 GLM-5.3 所做的全部工作就是扩展后训练)。
后训练环境也越来越像完整的工程岗位,而不是孤立的编程题。按 Z.ai 的描述,模型会拿到代码库、文档、计算集群、存储系统和实验结果,需要诊断问题、修改系统、跑实验并交出可验证的改进,同时保持正确性;部分任务被设计成近似资深工程师数天的工作量。
效果体现在公司自报的基准表上:Terminal Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,AutomationBench 从 26.2 涨到 48.2,Agents' Last Exam CLI 从 23.8 涨到 28.5。
GLM-5.3 与主要竞品在六项基准上的分数对比(图源:Z.ai 官方公告)。
但这份表同时说明 GLM-5.3 并非全面领先:Terminal Bench 3.0 上 GPT-5.6 Sol 为 34.6、Claude Fable 5 为 33.7;DeepSWE v1.1 上 Sol 为 72.7、Fable 5 为 69.7,都在 GLM-5.3 之上。
Z.ai 更强调效率。在其私有基准 Z.ai Code Bench 上,GLM-5.3 在 Max 推理档达到 34.5% 的任务完成率,每任务消耗约 75,000 输出 token,而 GLM-5.2 是 23.4%、约 96,000 token;High 档为 31.4%、约 50,000 token,对比公司自报的 Claude Opus 4.8 为 29.5%、120,000 token。仍低于 Fable 5 在 Max 档的 39.5%。由于 Code Bench 是 Z.ai 自己的评测,这些对比属于公司自报口径,而非独立测量。
漏洞发现拿了第一,漏洞利用还差一截
GLM-5.3 的后训练数据里加入了漏洞发现环境。公司的预期是让模型更擅长找漏洞,结果能力沿着利用链继续往上走。Z.ai 在公告里写:“As we scaled post-training, cyber capability developed faster than we expected”(随着后训练规模扩大,网络攻防能力发展得比我们预期更快)。
在漏洞发现环节,GLM-5.3 排到了第一:CyberGym 上拿到 84.5%(GLM-5.2 为 77.2%),高于 Z.ai 自报的 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。但优势没有延伸到完整利用链:ExploitBench 上 GLM-5.3 为 54.4%,是 GLM-5.2(24.4%)的两倍多,仍明显低于 Sol 的 76.5% 和 Mythos 5 的 78%;ExploitGym 在归一化的两小时预算下完成 105 个任务、六小时 130 个(GLM-5.2 为 29 和 39),Fable 5 达到 181 和 247,Sol 为 216 和 293。用 Z.ai 自己的总结:越靠近利用链上游,相对 GLM-5.2 的增幅越大,与闭源前沿的差距也越大。
公司还把这类能力放到了真实代码库上检验:自 GLM-5.2 起,与中国多家安全团队合作,经专家复核、筛选和去重后,在 269 个项目中累计找到 2,436 个漏洞,其中 1,097 个为中高危;53 个已公开披露,2,383 个在发布时仍处于禁运期。这些发现覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议,最早的漏洞 1981 年就已引入,平均潜伏 26.6 年。Z.ai 为此建立了公开的 Z.ai Security Disclosure Ledger 记录披露进度。
thinking 关不掉,旧客户端请求会直接失败
对存量开发者,GLM-5.3 是一次破坏性变更。模型支持 low、high、max 三档 reasoning effort,max 为默认值,也是 Z.ai 推荐的编码档位;但与旧版本不同,thinking 无法禁用。仍在发送 thinking.type: "disabled" 的应用,必须先改为 enabled 并指定 reasoning effort,再把模型标识切换成 GLM-5.3,否则按 Z.ai 的说法,请求会直接失败。对部分生产应用,这意味着一次真实的迁移,而不只是替换模型名。
权重扣两周:先商用,再开源
GLM-5.3 目前的入口只有 GLM Coding Plan 与 ZCode。ZCode 是 Z.ai 自有的编程 agent 环境,支持长时运行的“Goal”任务(规划、实现、测试、验证),可在 macOS、Windows 和 Linux 上使用。VentureBeat 还引述 Reuters 的报道称,Z.ai 正在为模型的部分高级能力引入管控,包括对敏感功能的“trusted access”做法。
订阅价格方面,个人 GLM Coding Plan 的 Lite 档促销价为每月 12.60 美元、每周 10,000 credits;Pro 档 56 美元(6 倍于 Lite 用量),Max 档 117.60 美元(14 倍)。Team 的 Standard 与 Premium 席位分别为每人每月 88 和 188 美元。计划已改为积分配额制,分别核算输入、缓存输入与输出 token,工作日高峰时段之外的调用只消耗 50% 积分。通用 API 定价尚未公布,生产环境的总成本暂时无法与 GLM-5.2 或竞品直接比较。
这次分阶段发布,偏离了 Z.ai 过去一年的节奏。6 月的 GLM-5.2 以 MIT 许可开放权重、提供 100 万 token 上下文,API 定价为输入 1.40 美元、输出 4.40 美元每百万 token,走的是开放权重加低价推理的路线。GLM-5.3 在安全评估完成前只开放订阅渠道,权重约两周后才放出。
Cursor 的“潜在严重漏洞”还没有独立确认
据 VentureBeat 报道,Z.ai 开发者关系人员 Lou 在 X 上发帖称,GLM-5.3 已在 Cursor 中发现一个“潜在严重漏洞”。Cursor 是近期被 SpaceX 收购的 AI 编程公司。VentureBeat 已在 X 上标记 Cursor 求证,截至其 8 月 14 日报道发布时仍在等待回复,这一说法尚无独立确认。
如果这一说法最终被证实,它正好落在 Z.ai 此次分阶段发布的理由上:让模型更擅长长程工程任务的同一种能力,也会让它成为更熟练的安全研究者。目前两个问题都没有答案:Cursor 的漏洞是否属实,以及约两周后权重是否如期放出。