AREX Feed Article
GLM-5.3 (Max) 拿下 WebDev 总榜第 8,开放权重后将成开源模型第 2
8 月 20 日 23 点 27 分(UTC),Arena.ai 官方 X 账号(21.7 万关注)宣布,Z.ai 的 GLM-5.3 (Max) 在 Code Arena: WebDev 排行榜上以 1597 分 位列总榜第 8,并称该模型"若开放权重发布,将成为开源模型第 2 名"(would sit at #2 among open models upon open weights release)()。同一则公告给出价格对照:以每百万 token 3.65 美元计,GLM-5.3 (Max)"与 Qwen3.8 (Max)($5.00/M)不相上下,且优于(out performs)Gemini-3.7-flash-high($2.86/M)和 DeepSeek-v4-flash-high($1.10/M)"。这段定价比较是 Arena 的单方表述。
这是 GLM-5.3 于 8 月 14 日发布约一周后,在第三方评测榜单上的一次进展。Arena 称 GLM-5.3 (Max)"推动了 Code Arena: WebDev 的帕累托前沿"(has shifted the Pareto frontier),并祝贺 Z.ai 团队"对开放生态的贡献";配图把 glm-5.3-max 标在帕累托前沿线上:1597 分、$3.65/M、Z.ai · MIT。
总榜第 8:1597 分背后是 1,734 张投票
显示,glm-5.3-max 的分数为 1597,置信区间 ±16,价格栏标为每百万 token 输入 $1.40 / 输出 $4.40,上下文窗口 1M,许可标注为 MIT。页面数据日期为 2026 年 8 月 19 日,共 596,892 张投票、117 个模型;Arena 在 8 月 20 日深夜(UTC)宣布这一结果,页面本身没有显示更新时刻。
排在 GLM-5.3 (Max) 前面的 7 个模型是:claude-opus-5-max(1691)、kimi-k3-max(1674)、qwen3.8-max(1669,标注 Preliminary)、claude-opus-5-high(1662)、grok-4.6-high(1629)、claude-fable-5(1626)和 gpt-5.6-sol-xhigh(1619)。紧接其后的第 9 至第 12 名是 gemini-3.7-flash-high(1588,Preliminary)、deepseek-v4-pro-high-20260813(1582)、glm-5.2-max(1582)和 deepseek-v4-flash-high(1578)。
一个可对照的细节:8 月 15 日的列出的前沿模型名单里还没有 glm-5.3-max,8 月 19 日的主榜单(117 个模型)上它已列第 8。GLM-5.3 (Max) 的 1,734 张投票在前 12 名里最少:claude-opus-5-max 有 7,709 票,glm-5.2-max 有 8,615 票,gpt-5.6-sol-xhigh 有 9,250 票。它的置信区间 ±16 分,也宽于相邻的第 7、9、10、11、12 名(±8 至 ±13)。
"开放权重后":权重目前还没有开放
Arena 推文里的原话带着条件:GLM-5.3 (Max)"若开放权重发布,将位列开源模型第 2",当前它只是按 API 接入评测的。排行榜页面目前已经把 glm-5.3-max 标注为 MIT 许可。
Z.ai 于 8 月 14 日发布 GLM-5.3 时在中写明:该模型与 GLM-5.2 共用同一基座,全部提升来自后训练;权重将在发布约两周后、安全评估与加固完成后开放。权重开放(预计 8 月底)之前,"开源第 2"只是 Arena 对一个尚未公开权重模型的预测性排位。
对照榜单自身的许可标注:总榜前 7 名中,除 Moonshot 的 kimi-k3-max 标为 "Kimi K3 license" 外,其余全部是 Proprietary。若按 Arena 的口径把 kimi-k3-max 计入开放权重序列,GLM-5.3 (Max) 的 1597 分正好排在它的 1674 分之后——这与榜单数据一致,也让"开源第 2"有了明确所指。
$3.65/M 的性价比主张,口径不只有一套
Arena 的定价比较基于帕累托图上的混合价格,图注标注为"每百万 token 混合价格(3:1 输入输出比例)"。帕累托页面列出的前沿模型价格包括:claude-opus-5-max $20/M、kimi-k3-max $12/M、qwen3.8-max $5/M、gemini-3.7-flash-high $2.86/M、deepseek-v4-flash-high $1.10/M 等。而主榜单的价格栏给 glm-5.3-max 标的是 $1.40 / $4.40(输入 / 输出),两种口径并存,$3.65/M 是 Arena 在帕累托语境下采用的混合价格。
分数对照:qwen3.8-max 1669 分,gemini-3.7-flash-high 1588 分,deepseek-v4-flash-high 1578 分;GLM-5.3 (Max) 的 1597 分高于后两者,低于 qwen3.8-max。"不相上下"与"优于"具体以什么为基准,推文没有展开。
混合价格口径本身在回复区受到了质疑。德国开发者、WellBlue 首席执行官 Dominik Bödger(同时是 Tigarius Ventures 的投资人)在 Arena 推文下写道:"这种混合定价方法说不通(simply doesn't make sense),因为不同模型生成的 token 数量完全不同;这里需要记录的是每个任务的平均成本。"()
发布一周,GLM-5.3 正在各张榜单上扩散
GLM-5.3 是 Z.ai 8 月 14 日发布的旗舰模型。Z.ai 在博客中称它是"最具能力的开源权重编程模型":自家 Z.ai Code Bench 上较 GLM-5.2 提升 50%,Terminal Bench 3.0 从 4.6 分升到 28.3 分,DeepSWE v1.1 从 46.2 分升到 66.9 分。这些数字出自 Z.ai 自己的发布材料。
8 月 20 日上午(UTC),Z.ai 的 Zixuan Li 发推称 GLM-5.3 在官方 DeepSWE 排行榜上拿到 69 分();十几个小时后,Arena 公布了它在 Code Arena: WebDev 的成绩。同一张 WebDev 榜单上,Z.ai 三代模型的轨迹是:glm-5.1(1510 分,第 30 名)、glm-5.2-max(1582 分,第 11 名)、glm-5.3-max(1597 分,第 8 名),三代 API 价格栏同为 $1.40 / $4.40。两代更新,分数提高 87 分,排名前进 22 位。
与 Z.ai 自家基准不同,Code Arena 的成绩来自社区投票:榜单页面显示累计 596,892 张投票,并公开每对模型的对战次数与胜率(A vs. B battles)统计。
权重落地之前,开源第 2 的头衔还悬着
开发者 Fahad Saleem 在 Arena 推文下回复:"这个排名配上 $3.65 很便宜($3.65 for that rank is cheap),我现在就会把它用在代码子步骤里;本地部署要等他们把模型放出来。"() 这句"等他们把模型放出来",点出 GLM-5.3 当前的状态:API 可用,权重按计划 8 月底开放。
截至撰稿时(发布后约两小时),Arena 这条推文累计约 1.3 万次浏览、130 个赞、7 次转发。榜单上"开放权重第 2"的位置,只有在 Z.ai 按计划开放权重之后才会坐实。在那之前,它是 Arena 给 1597 分(置信区间 ±16)的一个带条件预测。