AREX Feed Article
Aikido 提前实测智谱 GLM-5.3:pass@3 复现 75% CVE,比 GPT-5.6-Terra 高 7 个百分点
8 月 14 日,安全厂商 Aikido Security 的 AI Pentest Lead Philippe Dourassov 了他对 GLM-5.3 的一手评测:在 Aikido 的 CVE 基准上,GLM-5.3 以 pass@3 重新发现了 75% 的漏洞,比 GPT-5.6-Terra 高 7 个百分点,运行成本低 40%。
他写道,团队"提前拿到了 GLM-5.3 来评估其网络能力"(We received GLM-5.3 in advance to evaluate its cyber capabilities),并称它是"网络任务上最稳定一致的开源模型"。截至 8 月 16 日,这条推文有约 4.6 万次阅读、447 次点赞。
GLM-5.3 在 8 月 14 日下午发布,与 GLM-5.2 共用同一基座、全部增益来自后训练;此前官方公布的网络安全成绩均出自智谱自述,完整权重按计划要等安全评估与加固完成、发布两周后才开放()。
pass@3 的 75%,来自 32 个 CVE 的三轮运行
Dourassov 用一条三连推文给出完整结果。基准规模写在他附带的模型对比表里:32 个 CVE、3 轮运行,指标包括单轮与三轮召回率、Precision、F1,以及每发现一个 CVE 的成本($/CVE found)。
三个核心数字。第一,pass@3 下 GLM-5.3 重新发现 75% 的 CVE,比 GPT-5.6-Terra 高 7 个百分点(按此推算后者为 68%),同时运行成本低 40%。第二,一致性强:pass@1 平均能找出 60.4% 的 CVE,是他记录过的开源模型最高分。
第三,误报少:比他们测过的其他高召回率模型(包括 DeepSeek v4 系列)更少误报,输出"可靠得多"(far more trustworthy)。主推文以一句"Once again, @Zai_org has cooked"收尾,大意是 Z.ai 又做出了好东西。
针对基准污染的可能质疑,他也有回应。有评论者抛出这类担心后,Dourassov 在中说,团队做了数据污染的 sanity check,GLM-5.3 的输出转录里"没有发现任何可疑之处"(Nothing sus was found in the transcripts)。
第三条推文的结论更直接:GLM-5.3 是"既能发现漏洞、又能避开噪音和高成本的最佳模型",适合"通用网络安全任务",并附上 Aikido 的供开发者试用。
单独比一致性,14/32 领先两个身位
把一致性单拎出来。"大多数开源模型都不可预测,"Dourassov 写道,"GLM-5.3 在稳定发现漏洞上展现了真正的进步。"他给出五个模型的 x/32 分数:
- GLM-5.3:14/32
- DeepSeek V4 Flash:12/32
- Kimi K3:11/32
- Qwen 3.8 Max:10/32
- DeepSeek V4 Pro:10/32
这条推文没有解释分数的精确定义,但附上的热力图题为"按漏洞类型拆分的召回率"(Recall by vulnerability type),标注"% of 3 runs",把每个漏洞类型在 3 轮运行中的召回率按模型展开,GLM-5.3 是其中一列。
提前放行与 API 实测:评估窗口的第一份实证
这份评测的另一层信息在数字之外:权重并未开放,Aikido 是提前拿到模型的。
"in advance"的说法在评论区得到印证。X 简介写着"Helping build @Zai_org"的 感谢了这次评测,Dourassov 在里说"Thank you for letting us test the model early",并补了一句"the inference on your api was super smooth"。
提前放行来自 Z.ai 一方,测试跑在 Z.ai 的 API 上。财新 8 月 14 日的报道给出了官方时间表:完成安全评估和模型加固后,权重在发布两周后开放。Aikido 的实测正落在官方预留的评估窗口内。
在 Dourassov 发推约四小时后评论:GLM-5.3"大幅击败每一个美国开源模型:Nemotron、Laguna、Inkling,差距不是一点"(It's not close)。
该账号同时确认 GLM-5.3 与 GLM-5.2 同基座、全部提升来自后训练,并警告"如果美国继续走'Nemotron 委员会'路线而不是培育真正的竞争,就会继续输下去"。这是该机构的观点。
智谱官方的自评口径反而更保守。据财新,智谱称 GLM-5.3 在白盒代码审查与漏洞发现等安全任务上持平 Claude Mythos 5 和 GPT-5.6 Sol,但在考察深度推理和漏洞利用任务完成能力的测试中,逊于北美顶级闭源模型。
权重开放前,75% 仍是单方口径
75% 建立在 Aikido 的私有基准上,公开的推文串只给出 32 个 CVE 的规模,没有披露这批 CVE 的选取、任务构成、工具权限和失败处理。
评论者 (其简介自述专注检验各家前沿模型的工作流)提出保留意见:"有意思的比较是同等预算下的 pass@3。七个百分点差距只有在任务构成、工具访问和失败处理都公开到可以复现时才有意义。"
复现的机会要等到权重开放。按官方时间表,权重在发布两周后开放,按 8 月 14 日计算即 8 月 28 日前后。
到那时,任何团队都能拿到权重重跑同类基准,75%、60.4% 和"低 40% 成本"才有机会被第二个实验室复核。在那之前,这份评测是目前公开可见的、来自独立安全厂商的 GLM-5.3 网安实测,也仍是单方口径。