AREX Feed Article
AA 智能指数 60 分:GLM-5.3 追平 Kimi K3,并列开源权重最高
智谱(02513)8 月 14 日在发布的新一代基座模型 GLM-5.3,拿到第三方评测机构 Artificial Analysis 智能指数(Intelligence Index)的 60 分,与月之暗面 Kimi K3 并列成为得分最高的开源权重模型,比上一代 GLM-5.2 高 7 分。称,这一成绩让 GLM-5.3"晋身全球第四"。
8 月 19 日,智谱宣布 GLM-5.3 API 正式上线()。这个"并列第一"带一个前提:权重还没有开源。Artificial Analysis 在 8 月 18 日发布评测结果的中写明,GLM-5.3 与 Kimi K3 并列"当前最智能的开源权重模型",前提是"智谱按计划放出权重(assuming weights are released as per Z AI's guidance)";在它的上,GLM-5.3 目前仍标注为 Proprietary model(专有模型)。
60 分之上还有六款闭源旗舰
(v4.1.1)把 9 项评测合成一个分数:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 与 AA-LCR,覆盖数学、科学、编程和推理,全部由 AA 独立运行。
截至 8 月 22 日的上,60 分之上还有六行:Claude Opus 5 (max) 与 Claude Opus 5 (xhigh) 各 63 分,Claude Fable 5 (with fallback) 62 分,Claude Opus 5 (high)、GPT-5.6 Sol (max)、Grok 4.6 (high) 各 61 分。60 分这一档是 Grok 4.6 (xhigh)、Kimi K3 (max)、GLM-5.3 (max) 三家并列。AA 模型页显示,同价位可比模型的中位数为 35 分。
"全球第四"的说法出自香港经济日报的报道(正文未附榜单链接);AA 的推文与智谱 19 日公告给出的口径都是"并列开源模型第一"。智谱公告称,GLM-5.3"进入全球前沿模型能力区间,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰处于同一水平"。榜单随新模型加入与评测更新而变动,排位是时点数据。
并列开源第一的前提:权重还没放出来
AA 推文把条件写得很清楚:"一旦权重放出,它将成为并列领先的开源权重模型(Once the weights are released it will be tied as the leading open weights model)。"智谱官方博客发布时给出的时间表是"发布两周后放出权重,待安全评估和加固完成";19 日智谱再确认,模型权重"将于下周五开源",即 8 月 28 日。
19 日报道,推迟放出权重约两周的原因,是 GLM-5.3 检测安全漏洞的能力太强,智谱要先加强管控,把完整访问权限制在部分安全合作伙伴。
Kimi K3 那边没有这个悬念:据报道,月之暗面已于 7 月 27 日晚 11 时公布 K3 权重,允许全球开发者免费下载、微调与部署。2.8 万亿参数的 K3 是当时全球规模最大的开放权重模型,上下文窗口 100 万 token。在 GLM-5.3 权重放出之前,坐实开源榜首的只有 Kimi K3。
246 分的 Elo 跃升来自 agent 任务
GLM-5.3 沿用 GLM-5.2 的基座模型(AA 记录参数为 753B 总参数、40B 激活的 MoE 架构),智谱称所有提升都来自后训练:"为 GLM-5.3 所做的一切就是后训练扩展(Scaling post-training is all we did for GLM-5.3)。"
增量主要落在 agent 能力上:在真实世界知识工作评测 GDPval-AA v2 中,GLM-5.3 的 Elo 从 1524 跳到 1770,涨了 246 分,全榜第二,仅次于 Claude Opus 5(1855),比上一代开源榜首 Kimi K3(1668)高出 100 多分。
智谱自家口径的涨幅更猛:内部基准 Z.ai Code Bench 较 GLM-5.2 提升 50%;Terminal Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 涨到 28.5,均称开源 SOTA。
这轮涨分有代价。AA 测出 GLM-5.3 每任务约消耗 18,700 个输出 token,比 GLM-5.2 多约 20%、比 Kimi K3 多 27%,token 用得多直接抬高部署成本。知识可靠性评测 AA-Omniscience 从 4 分升到 14 分(开源第二,仍落后 Kimi K3 的 20 分),但幻觉率从 26% 升到 30%。
让权重发布变得敏感的能力是网络安全。智谱博客称,GLM-5.3 在 CyberGym 上拿到 84.5%,是该基准第一,超过 Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%);ExploitBench 得分 54.4,是 GLM-5.2(24.4)的两倍以上。智谱还披露,模型在与多家中国安全团队合作的 269 个真实项目中找到 2,436 个漏洞,其中 1,097 个为中高危,最老的可追溯到 1981 年。
每任务 0.68 美元,token 却多用 27%
AA 的账本:GLM-5.3 跑完一个智能指数任务的平均成本是 0.68 美元,是 GLM-5.2(0.44 美元)的 1.5 倍,但比 Kimi K3(0.84 美元)便宜 19%,比 GPT-5.6 Sol(1.23 美元)便宜 45%。
API 定价为每百万输入 token 1.40 美元、输出 4.40 美元,缓存命中折扣 81%(每百万 0.26 美元)。智谱称 API 定价与 GLM-5.2 保持一致,并称 GLM-5.3 实现了"前沿旗舰模型中最低的单任务成本"。成本上涨的一部分来自 token 用量:AA 记录 GLM-5.3 在智能指数评测中总计生成了 1.7 亿个输出 token,同类中位数是 7,200 万。
开源榜首的位置,Kimi K3 先坐实了
这次并列的背景,是月之暗面在 7 月底把开源权重模型的天花板抬高了一截。联合早报的报道提到,Kimi K3 公布时的基准表现曾引发全球 AI 概念股抛售潮;据彭博社报道,自 K3 问世以来,月之暗面单日销售额增长至少六倍,公司正寻求新一轮融资,目标估值 500 亿美元,并计划最早于今年赴港 IPO。
同一篇报道引述的数据显示,在 Kimi K3 与智谱 GLM-5.2 发布后,中国开放权重模型的 token 调用量占比已达 68%,但 AWS Bedrock、微软 Azure Foundry 与谷歌 Vertex AI 等全球头部云平台尚未全面支持这些模型。智谱自身则是 1 月 8 日在港交所主板挂牌的(02513.HK),原计划在科创板上市、未获监管意见后转道港股()。
AA 在 18 日的推文里给了一句总结:在 Kimi K3 与 GLM-5.3 之间,"开源前沿比以往任何时候都更接近闭源前沿"。这句话目前仍是带条件的——GLM-5.3 的权重是否在 8 月 28 日如期放出,将决定 60 分的并列从承诺变成事实,还是由已经放出权重的 Kimi K3 独占开源榜首。