AREX Feed Article
Command Code 上线 GLM-5.3 FlashX:Z.ai 高速档进入第三方平台与订阅套餐
2026 年 9 月 19 日 02:54(UTC,北京时间 10:54),面向开源模型的编码智能体平台 Command Code 的官方 X 账号宣布:GLM-5.3 FlashX 已在其平台上线。按推文所述,这是 GLM-5.3 Flash 的高速变体,标称约 200 TPS(每秒输出词元数)、1M 上下文窗口、支持文本/图像/视频多模态,向所有套餐与 API 开放。发布账号 @CommandCodeAI 是 Business 认证账号,这条在发布当天已获得 477 个赞、33,877 次浏览。这是 Z.ai 自家 API 之外,第三方平台就这一高速变体作出的官方可用性公告。
FlashX 不是新模型。9 月 18 日,Z.ai 在自家 API 上线的是同名服务档:它与 8 月 26 日以 MIT 许可开源的 GLM-5.3-Flash(320B 总参数、18B 激活的混合专家(MoE)架构、1M 上下文),变化在推理服务栈与价格——每百万 tokens 输入 $0.37、输出 $1.25,是 Flash 挂牌价($0.15/$0.50)的 2.5 倍,标称最高 200 tok/s。模型路由服务商 在 9 月 19 日的分析中提醒:这些速度数字都是厂商口径,当时没有任何外部复现。
推文之外,Command Code 官网已能查到 FlashX 的模型 ID 与价目
公告不止是一条推文。已经列出 GLM-5.3 FlashX 一行:1M 上下文,评分栏写着「not yet scored」(尚无评分),每百万 tokens 输入 $0.37、输出 $1.25、缓存读取 $0.075。的模型注册表同样收录了 z-ai/glm-5.3-flashx,用户可以通过 --model 参数或会话内的 /model 命令切换到它。多模态口径上,推文列的是文本、图像、视频,与 Z.ai 开发者文档一致,后者还多列了一项文件输入。
订阅套餐接入了,但 FlashX 在 GOAT 里每月只有 20 美元额度
推文称 FlashX「向所有套餐与 API 开放」。可以直接查证:GOAT 每月 $10、含 $70 额度,其中 GLM-5.3 FlashX 一行按 Z.ai 挂牌价计费,每月额度 $20——新接入的模型先按 2 倍杠杆给额度,Command Code 谈下折扣后额度会自动上调。按其估算模型,这笔额度折合每月约 4,720 次典型 agent(智能体)请求;相比之下,GLM-5.3 Flash 每月额度 $40、约 23,600 次。
第三方接入的时间线也可以对上:OpenRouter 的公开模型目录 显示,z-ai/glm-5.3-flashx 在 9 月 18 日 15:07(UTC)被收录——也就是 Z.ai 发布当天,上下文长度 1,048,576,定价同为 $0.37/$1.25,见其。Command Code 的公告比目录收录晚约 12 小时,补上的是订阅套餐这一层:Z.ai 的文档写明,GLM Coding Plan 目前尚未纳入 FlashX,订阅编码套餐的用户要用它只能按 token 付费;而在 Command Code,GOAT 订阅用户可以用月度额度调用这个档。
标称 200 tok/s 是峰值,OpenRouter 页面统计的 P50 是 70 tok/s
Z.ai 对加速来源的说法没有变:据 转述,FlashX 跑在约 10 万块国产加速器组成的集群上,用基于 SGLang 的自建推理栈、W8A8 量化,以及把多模态编码、预填充、解码拆开的分离架构。Z.ai 官方账号 9 月 17 日也这套服务 GLM-5.3-Flash 的基础设施,称从首次成功运行到投产不足两周、端到端吞吐较初始基线提升约 3 倍。这些全部是厂商口径。
对 200 这个数字要区分口径。OrcaRouter 指出,它是厂商报告的峰值,通常出现在短输出、缓存已热、集群空闲的请求上,而 FlashX 主打的长上下文多模态请求恰恰最难接近峰值;Artificial Analysis 在 Z.ai 自家 API 上实测底座模型 GLM-5.3-Flash 的输出速度是 98 tok/s(中位数)。
现在多了一个公开可查的数字。截至 9 月 19 日,OpenRouter 的 FlashX 模型页显示其网络内请求统计:P50(中位数)吞吐 70 tok/s,P95 157 tok/s,P99 约 215 tok/s,P50 往返延迟约 2.2 秒。中位数离 200 很远,但尾部请求确实能超过厂商标称的峰值。需要说明,这是请求遥测,不是受控基准;OrcaRouter 写分析时仍表示,Z.ai 之外尚无人公布过 FlashX 的吞吐测量结果。
回复区:有人夸快,有人问账单,也有人贴出错码
这条公告下的 29 条回复呈现出几种态度。 说「200 TPS 加 1M 上下文,就是为并行 agent 运行准备的」; 称「快得很,我刚刚就在用」。另一种担心来自 :「200 TPS 听着很好,直到高速变体开始幻觉出错误的 import 路径」——他认为多步编辑任务里,慢一些的模型通常更值。 只回了两个词:cost?(多少钱?)
服务状态也有杂音。 贴出 429 报错,提示「上游模型提供方暂时不可用」; 报告调用 deepseek 4.1 flash 时收到 503。这两条指向平台上的其他模型与稳定性,属于个别用户的即时反馈,说明不了 FlashX 档本身的表现。
截至发稿,FlashX 在 Command Code 模型目录里的评分栏仍停在「not yet scored」,针对这个档位的独立评测也还没有出现。