AREX Feed Article
Z.ai 开放 GLM-5.3-FlashX 试用申请:高速档进入 GLM Coding Plan,全部 API 用户可用
北京时间 9 月 22 日凌晨 0 点 04 分(UTC 9 月 21 日 16:04),Z.ai 负责人 Zixuan Li 在 :更快的 GLM-5.3-Flash 上线,模型代码为 glm-5.3-flashx,标称最高 200 tokens/s(每秒输出 tokens 数),在 GLM Coding Plan 与 API 上均按 GLM-5.3-Flash 的 2.5 倍定价,面向全部 API 用户开放,Coding Plan 用户可通过提交试用申请。Z.ai 官方账号 @Zai_org 在确认了这条公告。
这是该高速档三天内的第二次扩围:9 月 18 日,FlashX 随 Z.ai 上线 API,但当时的页面尚未把它纳入 GLM Coding Plan;9 月 19 日,面向开源模型的编码智能体 Command Code 宣布。
从“暂不纳入”到开放申请:改的只是入口
9 月 18 日的文档页给 FlashX 的位置很明确:glm-5.3-flashx 与 glm-5.3-flash 两个模型代码并列在同一页,规格相同——1M token 上下文、128K 最大输出、支持视频/图片/文本/文件输入,标称最高 200 tokens/s;而 Coding Plan 一节只写了 GLM-5.3-Flash——可用,配额为 GLM-5.3 的 3 倍——并以括注说明 FlashX“尚不向该订阅计划开放”。
9 月 21 日的公告明确了两个入口:API 侧面向全部用户开放;Coding Plan 侧从“不可用”改为“可申请”。显示 GLM-5.3-Flash 挂牌价为每 1M tokens 输入 $0.15、输出 $0.50;按公告所说的 2.5 倍计,FlashX 对应输入 $0.375、输出 $1.25。
公告约一小时后(北京时间 1 点 10 分),X 用户 @louszbd 发帖“我们刚刚上线了 GLM-5.3-FlashX:最高 200 tokens/s,Flash 的更快版本”,并说自己用下来“来回改代码顺畅得多”。
申请表单写明:限付费订阅、分批发放、每期约两周
申请入口是一份名为 “GLM-5.3-FlashX Coding Plan Trial Access Application” 的 Google 表单。申请人需要逐条确认三类条款:只有已付费的 GLM Coding Plan 用户才有资格申请;提交表单不保证获得访问权,试用名额按批次滚动发放,每期试用约两周,到期后模型访问自动关闭;FlashX 的配额消耗倍率为 GLM-5.3-Flash 的 2.5 倍,加上更快的推理速度,配额可能消耗得更快,需自行监控用量。
表单同时写明 Z.ai 保留对该计划的最终解释权。审批标准、每批名额和发放节奏均未公布。
公告发布两个多小时后已有用户提交。北京时间 2 点 26 分,X 用户 @0xjeffai 晒出,配文称 GLM-5.3 FlashX Coding Plan 试用“可以申请了”(原文为韩文)。
模型没换,速度数字仍是厂商口径
公告对 FlashX 的定位是“更快的 GLM-5.3-Flash”——同一模型的加速档,而不是一个新模型。Z.ai 在 8 月 26 日发布 Flash 时其为 320B 总参数、18B 激活参数的 MoE(混合专家)模型,以 MIT 许可证开源;进一步说明,Flash 的生产推理运行在大规模国产 AI 芯片集群上,基于 SGLang(开源推理框架)搭建专用推理引擎,采用 W8A8 量化(权重与激活值均为 8 位的量化方式)和编码—预填充—解码分离架构,端到端性能较初期基线提升 3 倍。本次 FlashX 公告与文档页均未说明加速档的具体技术配置。
200 tokens/s 目前可见的出处均为 Z.ai 官方渠道或对厂商数字的转述:9 月 18 日的文档、9 月 21 日的公告,以及 Command Code 帖子中转述的“约 200 TPS(每秒 tokens 数)”。截至发稿,本文引用的来源中没有独立实测;这个数字能否被独立复现,是这款高速档下一个可以核对的节点。