AREX Feed Article
GLM-5.3-Flash 上线两天被指不及 Ox Alpha,Z.ai 推送配置更新
8 月 28 日,Z.ai 的 Zixuan Li()在 X 上发文,称团队"昨天"已为 GLM-5.3-Flash 推出配置更新(configuration update),以改善部分 agentic(智能体式)用例的性能:"如果它在 8 月 26 日至 27 日期间在你的工作流中表现不及 Ox Alpha,请再试一次,并告诉我们体验是否有所改善。"原文为:"Yesterday, we rolled out a configuration update for GLM-5.3-Flash to improve performance in some agentic use cases. If it underperformed Ox Alpha in your workflow between August 26 and 27, please give it another try and let us know if the experience has improved."截至 8 月 29 日,这条推文获得超过 1,900 个赞、90 条回复和约 11.3 万次浏览。
推文里的参照物 Ox Alpha 并不是第三方竞品,它正是 GLM-5.3-Flash 本尊在匿名预览期使用的名字,Z.ai 于 8 月 26 日官宣揭晓了这一身份。言下之意,Z.ai 承认以官方名字上线后的头两天,GLM-5.3-Flash 在部分 agentic 工作流中的表现,不及它自己匿名预览时的水平。至于这次配置更新改了什么、覆盖哪些范围、带来多少提升,推文没有说。发帖的 Zixuan Li 是 Z.ai 的 Head, 显示其自 2024 年 7 月起负责 Z.ai 的全球产品、API 平台、合作与模型发布;2025 年 11 月他在 上介绍自己时说,除了全球合作、模型评估和 API 服务,GLM Coding Plan 也由他负责。
匿名预览的 ox-alpha,就是 GLM-5.3-Flash
Ox Alpha 于 8 月 20 日出现在 上,页面介绍称它是"为编码、持续性 agentic 工作和生产负载设计的推理模型",上下文窗口 1,048,576 tokens,由"选择在预览期保持匿名的第三方提供商"开发运营。它迅速成为当周最受欢迎的匿名模型:定位编码与 agentic 工作、1M 上下文,OpenRouter 只透露它由匿名第三方运营。
8 月 26 日,Z.ai 发布博客《》揭晓答案:"发布前,我们以 ox-alpha 为名在 OpenCode 和 OpenRouter 上匿名测试 GLM-5.3-Flash,以收集用户反馈。它迅速成为当周最受欢迎的模型,而这些流量全部由国产 AI 芯片承载。"OpenRouter 的 Ox Alpha 页面如今也挂着说明:"这款隐身模型由 ZAI 开发运营,已揭晓为 ZAI GLM-5.3-Flash",FAQ 里直接回答:"Ox Alpha 就是 ZAI 的 GLM-5.3-Flash。"
匿名期的热度有数据为证。Z.ai 博客配图显示,8 月 20 日至 25 日(UTC),ox-alpha 在 OpenRouter 上处理了 23.2T tokens,是第二名 deepseek-v4-flash(9.9T)的 2.3 倍;同期在 OpenCode 的 7 日用量榜上,它以 43T tokens 排在第一。
18B 激活参数,Flash 官宣主打编码与 agentic
8 月 26 日,Z.ai 博客、和 同日上线 GLM-5.3-Flash 的正式信息。它是 GLM-5 系列第一个原生多模态模型:总参数 320B、激活参数仅 18B,采用稀疏注意力与线性注意力混合的架构,上下文窗口 1,310,720 tokens,接受文本、图像和视频输入,支持工具调用。OpenRouter 显示其于 8 月 26 日上线,标价输入 $0.075/1M tokens、输出 $0.25/1M tokens,Z.ai 渠道显示限时五折至 9 月 9 日;目前由 21 家提供商托管。
官方基准把卖点押在编码与 agentic 上:博客称其在 DeepSWE v1.1 上拿到 63.4(GLM-5.2 为 46.2)、AutomationBench v1.0.6 上拿到 48.8(GLM-5.2 为 26.2),Z.ai Code Bench v1.0 最高档 29.0,接近 Claude Opus 4.8 的 29.5;以折后每任务 $0.045 的成本拿下 Artificial Analysis 智能指数 57 分,博客称此前达到这一智能水平大约需要 10 倍成本。开发者文档还强调,原生视觉能力让模型能观察界面、渲染结果和交互反馈,并支持办公文档与金融研究工作流。
上线头两天:官方版与匿名版的落差
推文所指的问题窗口(8 月 26 日至 27 日)正是官方上线后的头两天。回复区里,有用户贴出了自己的对比记录。开发者 Ivan Kuznetsov()说,他"昨天刚用 Max 模式跑了基准,发现它比 Ox Alpha 的 High 模式跑得还差,今天一直在调试基准,想搞清楚哪里出了问题"。MatZERØ()说得更直接:"恰恰相反。GLM 5.3 Flash 现在感觉像被削弱了,或者被严重量化了。把 Ox Alpha 的原始实力还给我们!"Jeffrey Behnke()则报告了另一种体验:"Ox 对我来说正是如此,它写得不错,但在一些 agentic 任务上失败了。所以我肯定会再推一下 GLM-5.3-Flash,看看它变了什么。"
这些是用户在回复区的自述,Z.ai 没有点名具体场景,也没有给出复现数据。但推文本身把 8 月 26 日至 27 日圈成了问题窗口,与官方上线的头两天完全重合;按推文的说法,配置更新在 8 月 27 日上线,正好落在窗口末尾。
配置更新,官方只说了一句话
关于这次更新,目前能核实到的官方说明只有那条推文:对象是 GLM-5.3-Flash,性质是"配置更新"而非新权重,目标是"部分 agentic 用例",上线时间是推文所称的"昨天"。Z.ai 没有说明更新内容、生效范围或性能数据;其博客与开发者发布日志里,也没有这次更新的说明条目。
回复区里,用户的猜测集中在几个方向。Aleksandar Janca()问:"配置里到底改了什么?是路由,还是你们那边的系统提示词调整?"Rimas()问的是"采样参数,还是工具调用处理里的什么东西"。Greg Glazewski()计划当天重测,但他想先确认"这到底是模型本身的问题,还是更新窗口期只是限流变少了"。Marvin()把这次更新概括为"糟糕的 48 小时之后,安静地打一个配置补丁,这是最诚实的发布说明格式"。
这些猜测并非凭空而来:OpenRouter 上该模型由 21 家提供商托管,支持按价格、速度或工具调用精度路由请求,同一个模型在不同服务商手里的表现可能并不一致。"配置更新"可能落在采样参数、推理设置、路由策略或服务端限流等任何一层,但推文没有给出答案。
重测已经开始,"改了什么"仍无答案
截至 8 月 29 日,回复区已出现第一批重测反馈。Hamza()总结了当时的观察:"回复里有趣的一点是:对一些人来说质量似乎变好了,但延迟仍然被频繁提起。这次配置到底有没有动推理或延迟,还是主要影响任务成功率?这大概是我第一个要重测的东西。"Jeffrey Behnke 也在推文发出后不久表示,会再推 GLM-5.3-Flash 看看变化。
截至发稿,Z.ai 没有公布配置更新的具体内容,也没有给出重测数据;官方版与匿名版之间的差距是否被这次更新抹平,目前没有公开数据可以判断,只能靠用户重跑自己的工作流来验证。Zixuan Li 在推文里向受影响用户要的,也只是一个反馈:"告诉我们体验是否有所改善。"
参考链接
- _