AREX Feed Article
Z.ai 上线 GLM-5.3-FlashX 加速推理档:同一开源底座、2.5 倍定价,标称 200 tok/s 尚无独立复现
9 月 18 日,Z.ai 在自家 API 上线了 GLM-5.3-FlashX。这次上线的增量不在模型:跑的仍是开源底座 GLM-5.3-Flash 的同一套权重——320B 总参数、18B 激活的 MoE(混合专家,Mixture of Experts)架构、1M tokens(词元)上下文、MIT 许可——变的是底下的推理服务栈和价签。据 9 月 19 日发布的独立分析,FlashX 定价为每百万 tokens 输入 $0.37、输出 $1.25,是底座 GLM-5.3-Flash 挂牌价($0.15/$0.50)的 2.5 倍;Z.ai 标称其输出速度最高可达 200 tokens/s。
截至 9 月 19 日发稿,这个 200 tokens/s 仍只是厂商口径的峰值。 在 Z.ai 自家 API 上实测底座模型的输出速度为 94.6 tokens/s(OrcaRouter 的分析引述为 98 tokens/s),两种口径不可直接比较;FlashX 目前没有任何独立评测,Z.ai 所述的加速机制也没有第三方复现。
同一套权重,一个新的计费档
FlashX 没有自己的权重。按 OrcaRouter 的整理,它是一个托管服务档:底座的架构、上下文和文本与图像输入原样适用,Z.ai 也没有发布任何 FlashX 专属评测——OrcaRouter 的解释很直接,没有新模型可评。
价格才是这次上线真正的增量。OrcaRouter 于 9 月 19 日截取的 Z.ai 官方定价页显示,GLM-5.3-FlashX 排在 Latest Models 一栏:输入 $0.37、缓存输入 $0.075、输出 $1.25,缓存存储限期免费;紧挨着的上一行是底座 GLM-5.3-Flash 的 $0.15、$0.03、$0.50——底座这一档的挂牌价也能在 直接查到。OrcaRouter 给出的人民币口径换算是:FlashX 每百万 tokens 输入 ¥2、输出 ¥7,对底座的 ¥0.8 和 ¥2.8。
另一个影响账单的细节:据 OrcaRouter 转述,Z.ai 明确表示 FlashX 暂不纳入 GLM Coding Plan,订阅用户调用它要按 token 另行付费。
加速来自哪里:约 10 万块国产加速器上的自建栈
Z.ai 把速度归因于基础设施。按 OrcaRouter 转述的厂商说法,FlashX 跑在约 10 万块国产加速器组成的集群上,推理栈包括:基于 SGLang 的推理引擎(SGLang 也是模型卡列出的本地部署框架之一)、W8A8 量化(权重与激活值均用 8 位数值表示)、INT8/FP8/BF16 混合的缓存量化,以及编码—预填充—解码分离架构——把多模态编码和 token 生成拆到不同阶段,互不阻塞。Z.ai 称这套栈在同样硬件上把端到端服务吞吐比最初基线提升了约 3 倍,还说一个由 GLM-5.3 驱动的智能体(agent)参与调优了这套基础设施。
这些说法全部来自 Z.ai 自己,至今没有外部复现。OrcaRouter 的评价有两面:这类服务档上线通常是工程胜利,列出的架构组合也正是冲着这种收益去的标准工具箱;但 200 tokens/s 是峰值——峰值出现在短输出、热缓存和不拥堵的集群上,而 FlashX 主打的长上下文多模态请求,偏偏是最难摸到这个数的负载。
200 是峰值,95 是实测
Artificial Analysis 的模型页对底座 GLM-5.3-Flash 的记录是:在 Z.ai 自家 API 上实测输出速度 94.6 tokens/s(页面摘要四舍五入为 95),首 token 延迟 2.50 秒;OrcaRouter 引述的读数则是 98——该实验室的数据持续滚动更新,但两个读数指向同一个结论:实测不足 100 tokens/s,约为厂商峰值的一半。OrcaRouter 强调,200 和 95 不是同一种数字:一个是厂商说服务能摸到的天花板,一个是独立实验室在真实请求上测出的实际水平;它给开发者的建议是把 200 当广告,拿自己的负载去测。
独立数据目前只有底座的。截至 9 月 19 日,Z.ai 之外没有人发布过 FlashX 的吞吐数字;Artificial Analysis 的收录了 17 家托管 GLM-5.3-Flash 的服务商,里面也还没有 FlashX 这一档。
2.5 倍价差落在谁的账单上
输出是最贵的一侧,价差在这里咬得最狠:两个档位上,输出单价都约是输入的 3.3~3.4 倍。OrcaRouter 算了一笔账:一个每天生成 100 万输出 tokens 的批处理任务,从底座换到 FlashX,一年多花约 $274——而批处理是没人盯着进度条等的工作。
划算的场景是延迟可以摊销的:一个串行调用 10 次模型的 agent 循环,每次省下 2~3 秒,整个任务就买回约半分钟的等待。交互式代码补全、实时对话、任何被人或上游服务卡在「下一个 token」上的流水线,属于 OrcaRouter 认为这笔交易通常成立的地方;批量、离线、吞吐型的工作则留在底座,或者干脆自托管开源权重。
开源权重本身留了旁路。Artificial Analysis 追踪的第三方托管方里,同一套 GLM-5.3-Flash 权重的实测输出速度从 DeepInfra 的 17.3 tokens/s 一路到 Inco (FAST) 的 474.6 tokens/s;按 7:2:1 的缓存命中/输入/输出混合价计,Z.ai 自家的 $0.10 已排在最低之列。同一套权重的速度选项,不止 FlashX 一档。
底座没变:42 分的天花板
FlashX 继承的不只是底座的权重,还有它的能力轮廓。Artificial Analysis 给 GLM-5.3-Flash 的智能指数(Intelligence Index)得分是 42,同类开源权重的中位数为 18;Z.ai 模型卡的措辞是「在编码和智能体基准上接近 Claude Opus 4.8」。OrcaRouter 的看法是:两个说法各自成立,但不是一个说法——42 分与厂商对标的前沿梯队之间还有距离,这正是它坚持给厂商数字贴上「厂商口径」标签的原因。
底座本身于 8 月 26 日以 MIT 许可发布,权重放在 。模型卡称它是 GLM-5 系列第一个原生多模态模型,首次引入稀疏+线性混合注意力,并采用流形约束超连接(mHC);OrcaRouter 整理的数字是,这套设计把对 GLM-5.3 的注意力计算削减约 3 倍、KV 缓存(推理时保留的键值中间结果)削减约 4.4 倍,也是这个 320B 模型只激活 18B 参数就能便宜伺服的原因。输出上限为 131,072 tokens(OrcaRouter)。速度上,这一实测值高于同类开源权重 71.8 tokens/s 的中位数——OrcaRouter 的概括是:它按价格算快,按级别算不快。
等一个独立数字
OrcaRouter 给 FlashX 的定位是一句有条件的好话:在有人测出之前,它是一个「卖峰值数字的有前景服务档」。买与不买因此归结为目标客户是谁:工作负载卡在延迟上、且已经认定底座合适的团队值得买;对其他人,OrcaRouter 的原话是:「你花 2.5 倍价钱买到的智能,是你本来就已经有的那一份。」
这次上线同时是一次商业测试。OrcaRouter 把它放进这样的框架里:一家过去一年以旗舰约十分之一的价格把接近前沿的模型开放给开发者的公司,如今要回答的是开发者是否愿意单独为速度付费,答案会决定下一个加速档怎么定价。而在第一个独立测试发布之前,200 tokens/s 在真实负载下意味着什么,还没有第三方数据可以回答。