AREX Feed Article
Vercel CEO 实测后称:GLM-5.3 是『新的开源前沿』
8 月 16 日 23:06(UTC,北京时间 8 月 17 日 07:06),Vercel 首席执行官 Guillermo Rauch(@rauchg)发推公布了对智谱(Z.ai)GLM-5.3 网络安全能力的实测结论:「我们评测了 GLM 5.3 的网络安全能力。它是新的开源前沿。」(We ran evals on GLM 5.3 cybersecurity capabilities. It's the new open frontier.)接着给出理由与一个具体后果:鉴于 GLM-5.3 更低的成本,他预计这对防御性安全工作是个利好——「例如,这意味着你可以至少多跑 3 倍的 deepsec.sh」。截至核验时,推文已获 1,050 个赞、13.5 万余次观看。
这条表态是 GLM-5.3 安全能力验证进程的最新一环。8 月 14 日,发布 GLM-5.3,称「为 GLM-5.3,我们只做了后训练扩展」,网络安全能力是训练规模扩大后「发展快于预期」的涌现结果,完整权重计划在发布两周后开放;同一天,公布提前实测:pass@3 复现基准中 75% 的 CVE,比 GPT-5.6-Terra 高 7 个百分点,运行成本低 40%;智谱的发布说明还介绍了配套的公开漏洞披露台账 。Rauch 的表态因此是继 Aikido 之后,又一份公开的第三方验证——而且来自一家自己就在做开源安全工具的公司。
deepsec.sh 至少多跑 3 倍的成本逻辑
Rauch 推文链接指向的 正是 Vercel 自家的开源项目:一个「全仓库安全审查」工具。官网这样解释出发点:现代 AI 模型很擅长安全代码审查,但多数审查方案只跑在 pull request 上,意味着大量存量代码从未被审查过,半年前的代码也还是由旧模型审的。deepsec 改用「规模化的虚拟机扇出」(scaled VM fanout)对全部存量代码做审查,开源、运行在用户自己的基础设施上,并支持强 agent 沙箱。
「至少多跑 3 倍」的前提是成本:deepsec 要把全部存量代码过一遍模型,单位价格直接决定同一笔预算能跑多少轮。需要说明的是,这条推文没有公布评测方法、基准或任何分数——全文只有两句话加一个链接——「3 倍」和「开源前沿」目前是 Rauch 基于 GLM-5.3 成本与实测体验给出的个人判断,他用的词也是「我预计」(I expect)。成本侧的第三方数据则有 Aikido 的实测为证:GLM-5.3 运行成本比 GPT-5.6-Terra 低 40%。
cvd.z.ai 台账:2,436 项收录,2,383 项仍在禁运
如果 Rauch 的推文是外部视角,cvd.z.ai 则是智谱自己的账本。这个随 GLM-5.3 发布上线的披露台账当前收录 2,436 项漏洞:53 项已公开披露,2,383 项仍在禁运(embargo)中;其中严重及高危 1,097 项(Critical 107、High 990),覆盖 269 个开源项目,影响时间跨度 45 年——最早的缺陷可追溯至 1981 年,平均每个漏洞在被发现前已潜伏 26.6 年。
Z.ai 博客交代了这些发现的来历:从 GLM-5.2 起,智谱与中国多个安全团队合作,用模型扫描真实代码库,经专家复核、筛选、去重后得到这 2,436 项。台账近期公开的条目包括:Linux 内核 6lowpan 修复错误路径上的 use-after-free(CVE-2026-64452,潜伏 11 年)、Apple Safari/WebKit 的内存处理缺陷(CVE-2026-43663)、FreeBSD ptrace PT_SC_REMOTE 参数验证缺失导致的 32GiB memmove 下溢(CVE-2026-45253)、GStreamer librfb 的堆越界写(CVE-2026-59691)等。
这组数字把「新的开源前沿」放回了语境:账本中 97.8% 的条目仍处于禁运期,意味着智谱在发布模型的同时,也接管了一批真实漏洞的披露节奏。等这些条目陆续公开,外部才能逐条核对模型产出与账本记录是否对得上。
「不该再对这些中国模型感到意外」
在 Aikido 与 Rauch 之外,独立研究者的解读同一周落地。8 月 14 日,Interconnects 作者 Nathan Lambert(@natolambert,曾在 Ai2 共同领导 OLMo 项目)发布对 GLM-5.3 的独立分析,直言:「GLM 5.3 笔记,以及我们为什么不该再对这些非常强的中国模型感到意外——大部分内容是我在说服自己走出否认:是的,这些模型是真的。」该推文获 491 赞、11.6 万次观看。
Lambert 在里的核心判断是:这主要不是蒸馏故事("Hint: It's really not a distillation story")。他给出的机制包括:中国实验室的发布节奏以天计、美国实验室以月计,后者的大量发布前测试时间给了前者持续爬升基准的机会;Z.ai 的优势在强化学习后训练而非预训练。关于网络安全能力,他引述智谱的发布声明:「选定的安全合作伙伴将先在受控环境中评测 GLM-5.3,更广泛的访问与 API 将随后跟进;安全评估与发布准备完成后,我们将发布 GLM-5.3 的完整权重。」Aikido 的提前评测与 Rauch 的公开表态,都落在这个权重尚未开放的时间窗口里。Lambert 的结论更冷:开放权重终究会来,「能力扩散由最低共同标准决定」,单靠任何一家公司都处理不了,需要政府或行业联盟拿出工业级指引。
权重还未公开,验证只能靠提前访问
目前悬而未决的环节是权重本身。Z.ai 博客写明,GLM-5.3 完整权重将在发布两周后、安全评估与加固完成后公开;截至 8 月 17 日,模型仍通过 GLM Coding Plan 等渠道可用。这意味着三份相互独立的材料——Aikido 的 75% CVE 复现、Rauch 的「开源前沿」、账本的 2,436 项收录——都建立在提前或受限访问之上;权重要等发布两周后才公开,届时本地复现的公开验证才会成为可能。
账本同样处于进行时:2,383 项禁运条目何时、以什么节奏披露,决定「GLM-5.3 找到的漏洞」能否被逐条核实。而对防御侧,Rauch 的期待若成立,后果是具体的:像 deepsec.sh 这样把审查范围从 PR 扩展到全部存量代码的工具,运行频率将随单位成本下降而成倍上升——而账本数据显示,那些旧代码里的缺陷平均潜伏了 26.6 年才被发现。