AREX Feed Article
GLM-5.3-Flash 进入 Agent Arena:开源第 4、总榜第 19,中位成本 0.12 美元/任务
8 月 31 日,AI 评测平台 Arena.ai(X 平台粉丝约 21.9 万)在中宣布,Z.ai 的 GLM-5.3-Flash 进入其 Agent Arena 榜单。按公告口径,评估基于 9,000 多次真实智能体(agentic)会话,模型的中位成本为 0.12 美元/任务、净提升 +4.6%,开源模型排名第 4、总榜第 19,位置介于 DeepSeek V4 (High) 与 GPT-5.6 Luna (xHigh) 之间。Arena.ai 称,GLM-5.3-Flash「重塑了 Pareto 前沿」(reshaped the Pareto frontier)。
同一份公告还给出一个同门对比:GLM-5.3-Flash 恰好压过自家 GLM-5.3 (Max) 一位,Max 总榜第 20,净提升 +3.7%,中位成本 0.45 美元(数据),是 Flash 的 3.75 倍。
五个信号拆开看:只有 Bash Recovery 为负
紧随其后的列出了 5 个分项信号:确认成功(Confirmed Success)+15.3%(该项排名第 4)、称赞对抱怨(Praise vs. Complaint)+4.9%、可引导性(Steerability)+2.4%、命令失败恢复(Bash Recovery)-0.7%、工具幻觉(Tool Hallucination)未发现问题。
Arena.ai 的实时榜单页面给出了更细的数字:截至 8 月 31 日,GLM-5.3-Flash 的净提升为 4.41%±1.37%,Confirmed Success 为 15.21%±2.85%,累计 9,970 次会话。每任务中位成本 0.12 美元、中位输出 31,700 tokens,API 标价 0.15 美元/0.50 美元每百万 tokens(输入/输出),模型以 MIT 协议开源。
官宣口径的 +4.6% 是配图上 +4.56% 的取整写法;页面当前的 4.41%±1.37% 则是会话继续累积后的最新值,说明榜单分数实时浮动。
0.12 美元在 Pareto 前沿上买到什么
「介于 DeepSeek V4 与 GPT-5.6 Luna 之间」指的是成本-性能前沿图上的位置,不是总榜名次。按榜单数据:DeepSeek V4 Pro (High) (0813) 净提升 5.90%、中位成本 0.23 美元;GPT-5.6 Luna (xHigh) 净提升 2.13%、中位成本 0.08 美元。
GLM-5.3-Flash 以 0.12 美元拿下 4.41%,恰好落在两者之间:比 DeepSeek 便宜约一半,净提升只低 1.5 个百分点;比 Luna 贵 0.04 美元,净提升却高 2.3 个百分点。
前沿的另一端是高价区间:总榜第一的 Claude Opus 5 (High) 净提升 13.77%、中位成本 2.55 美元;Kimi K3 (Max) 以 0.79 美元做到 8.74%。榜单页面标注 8 月 31 日数据,共 2,144,575 次会话、56 个模型。
发布不到一周:320B 参数、18B 激活、MIT 协议
GLM-5.3-Flash 是 8 月 26 日才发布的模型,称,这是 GLM-5 系列第一个原生多模态模型,1M token 上下文窗口,320B 总参数、仅 18B 激活参数,MIT 协议开源。发布前它曾以 ox-alpha 代号在 OpenCode 和 OpenRouter 上匿名测试,测试期间的流量全部由中国 AI 芯片承载,这是 Z.ai 自己的说法。
Z.ai 的给出的自评是:以「十分之一的价格」超过 GLM-5.2,在 Artificial Analysis 智能指数 v4.1.1 上拿到 57 分、折扣价 0.045 美元/任务,并同样使用了「推动 Pareto 前沿」的说法。这是厂商口径,与 Arena.ai 的榜单口径是两套数字。
Agent Arena 本身于 6 月 4 日上线。按 Arena.ai 的,GLM-5.3 (Max) 于 8 月 24 日进入该榜,Flash 则在 8 月 26、27 日先进了 Code Arena: WebDev 和 Text/Vision Arena,几天后登上 Agent Arena。按 Arena.ai 8 月 14 日的,该榜单在真实的长周期 agentic 任务上测量模型:模型可调用 web 搜索、文件系统和终端工具完成任务,用因果追踪方法衡量「相对平均模型」的结果表现。
回复区:质疑「重塑」与追问「Grok 4.6 在哪?」
截至 9 月 1 日上午,公告推文获得约 460 个赞、40 次转推和 29 条回复。质疑集中在「重塑 Pareto 前沿」这个说法上。账号「no tunnel, many lights」(@lapax)反问:「这怎么就算重塑 Pareto 前沿了?听起来像夸张」。
自称每日追踪 AI 定价的 TokenBurn Index 认为,中位成本/任务「是正确的那条轴,但它也埋掉了不少东西」:同属 GPT-5.6 家族的 Luna 与 Cyber 标价相差约 60 倍(0.20 美元对 12.50 美元),「一个模型可能只是靠话少而不是靠便宜靠近前沿」。榜单数据部分支持这个提醒:Luna 每任务中位输出 15,400 tokens,Flash 是 31,700。
成本口径被单独算账。自称 AI 构建者的 Luke(The HYPE Critic)写道:0.12 美元听着便宜,「直到你算算一个真实产品 agent 在五分之一失败率下需要多少次这样的『便宜』调用」;Maximus 则提醒「中位数有意思,但分布更重要,一个离群任务就能毁掉预算」。
正面声音同样不少。自称从事 Physical AI 与机器人的 Steven Cheng 评论「在成本和性能上双杀 Max 版?这波 vibe coding 能量很足」;The AI Therapist 称 GLM 们是「开源界的对冲基金」,「0.12 美元/任务意味着 Z.ai(zhipu)把推理卖得比大多数人写推文的时薪还便宜,套利要来了」;中文用户「安叫兽」的评论是「这个成本和提升幅度放一起看,挺能打的」。
回复里反复出现「Grok 4.6 在哪?」。按 Arena.ai 的更新日志,Grok 4.6 (xHigh) 在 8 月 27 日就已进入 Agent Arena,目前总榜第 16、净提升 5.76%,中位成本 1.12 美元,约是 Flash 的 9 倍。
便宜的一端正在变挤,数字仍只有一家口径
需要提醒的是,上述数字全部来自 Arena.ai 基于自家会话数据的评估口径。一家基准机构对自己平台上模型表现的公告,本身不等于独立验证。
在这个前提下,公告里有两件事值得盯住。其一,自称「在 agent 上折腾小工具」的 anytan 注意到:「0.12 美元的中位成本还能排开源第 4,这条曲线的便宜一端正在快速变挤」。榜单上 DeepSeek V4 Flash (High) 中位成本 0.15 美元、Kimi K2.7 Code 0.16 美元、GPT-5.6 Luna 0.08 美元,都挤在同一价位段。
其二,五个信号里,主推文只单独点名了 Confirmed Success,唯一为负的 Bash Recovery(-0.7%)只出现在补充推文的列表里。下一次榜单更新时,Flash 的 9,970 次会话还会继续累积,4.41% 和「第 19」的位置都会变动,而这 0.12 美元的任务成本在真实生产负载下能否站住,公告没有给出答案。