AREX Feed Article
智谱 GLM-5.3-Flash 推理调用超 10 万张国产芯片,国内定价为 GLM-5.3 十分之一
智谱 GLM-5.3-Flash 的集群规模与定价,出现了官方口径之外的新数字。华尔街见闻 8 月 26 日刊载的称,智谱调用超过 10 万张国产芯片集群为 GLM-5.3-Flash 提供推理服务;国内定价为每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元,正好是 GLM-5.3 的十分之一,上线前两周再半价。
作为对照:8 月 26 日智谱发布 GLM-5.3-Flash,这是 GLM-5 系列首个原生多模态模型,320B 总参数、18B 激活,MIT 许可、1M 上下文;发布前它以 ox-alpha 身份在 OpenRouter 与 OpenCode 匿名测试,称其成为当周最热门模型,流量"全部由中国 AI 芯片承载",权重已在 公开。
官方口径数万颗,晚点披露超 10 万张
官方博客对集群规模的表述停留在"数万颗":生产级 Encode-Prefill-Decode(EPD)分离架构"能够在数万颗国产加速器上实现高效可靠的服务"(tens of thousands of domestically developed accelerators)。
晚点给出的数字高一个量级:GLM-5.3-Flash 推理服务调用超过 10 万张国产芯片集群,线上流量均由国产芯片承接。据其了解,算力供应商"或来自华为、摩尔线程与海光",智谱官方没有评论这一信息,名单目前仍属未证实口径。
关于国产芯片的性价比,晚点援引智谱技术文档称,其集群"硬件效率及单位 token 成本已经达到了与主流英伟达 GPU 相当的水平",文档未明确具体型号。
官方博客给出了配套机制:为克服单芯片算力与显存偏小的限制,智谱在 SGLang 之上自建专用推理引擎,以计算换带宽、通信换带宽,配合 W8A8 量化、混合 INT8/FP8/BF16 缓存量化与 Layer Split 等优化,端到端服务性能较同硬件初始基线提升 3 倍。
国内定价:输入 0.8 元、输出 2.8 元
晚点报道的国内价格:每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元,约为 GLM-5.3 的十分之一,上线前两周半价。横向对比 8 月全面提价后的 DeepSeek V4 Flash(谷时价输入 1.5 元、输出 4.5 元、缓存 0.05 元),晚点判断综合输入与输出成本后,GLM-5.3-Flash 在绝大多数常规调用场景下更便宜。
海外价格同步上架。显示,GLM 5.3 Flash 于 8 月 26 日上线,由 Z.ai、NovitaAI、GMICloud、Cloudflare、DeepInfra、io.net、Baseten 共 7 家 provider 托管。经 ZAI 的限时 5 折(至 9 月 9 日 16:00 UTC),输入 $0.075、输出 $0.25、缓存读取 $0.015 每百万 token,原价分别为 $0.15 与 $0.50。
晚点给出的对照是:Claude Opus 4.8 官方输出价 25 美元,GLM-5.3-Flash 海外输出价 0.5 美元。
Ox Alpha 的匿名流量底子
匿名测试期的流量规模,官方博客用两张榜单说明。8 月 20-25 日 OpenRouter 上 ox-alpha 以 23.2T token 居首,是第二名 deepseek-v4-flash(9.9T)的 2.3 倍;OpenCode 榜上 ox-alpha 以 43T 居首。晚点报道称,ox-alpha 匿名测试 5 天流量累计超 50T,因为完全免费,"刷新了 OpenRouter 与 OpenCode 流量增长纪录"。
OpenRouter 页面列出了正式上架后的主要调用方:向该模型发送流量最多的应用是 Nous Research 的开源自主 agent Hermes Agent(53.4B tokens)与 Anthropic 的 Claude Code(36B tokens),其后是 omp(26.5B)与 DeepSeek Harness(14.1B)。
页面 FAQ 直接写明:匿名模型 Ox Alpha 已被揭晓为 ZAI 的新模型 GLM-5.3-Flash。
抢量窗口来自市场结构变化。晚点报道,8 月 DeepSeek 全面提价(V4 Flash 输出价从每百万 token 2 元涨到 4.5 元、高峰 9 元)后,OpenCode 上 DeepSeek V4 Flash 调用量掉了一半。
同一篇报道还提到,匿名发布在智谱有先例:今年春节前夕,OpenRouter 上出现名为 Pony Alpha 的模型,后被证实是智谱的 GLM-5。
SemiAnalysis:每天 100T token 跑在中国芯片上
分析机构 SemiAnalysis 在 8 月 26 日 14:42 UTC 的中确认 Ox Alpha 即 GLM-5.3-Flash,并写道:"令人震惊的是,每天 100T token 的推理服务由中国芯片承载。"
补充:这 100T/天还是免费 token,"而人们此前认为只有前沿实验室才有这个量级的算力"。该推文获得约 2222 赞与 34.8 万次浏览。
同日 14:12 UTC 给出方向性确认:"此前以 Ox Alpha 预览,完全运行于中国 AI 芯片",浏览量约 372 万。100T/天这个具体数字出自 SemiAnalysis 的推文表述,回复区已有质疑:用户 称它是"免费周的承诺容量而非实测吞吐",按其引述的推算,维持该规模约需 58 万 GPU 当量,"对这个体量的实验室说不通";用户 则称 OpenRouter 端实际峰值"大约只有 15-20T/天"。
第三方部署配方已就绪
开源侧的可核验进展同时到位。Hugging Face 权重页显示,zai-org/GLM-5.3-Flash 权重公开可下载:321B 参数,提供 BF16、F8_E4M3、F32 格式,模型卡重述官方定位并引用 GLM-5 技术报告(arXiv:2602.15763)。
已上线该模型的完整指南:321B/18B 激活 MoE、45 层 KDA 线性注意力与 NoPE 稀疏 MLA 混合、每 token 路由 8/288 专家、最大上下文 1,048,576 token。默认 FP8 权重约 306 GiB,要求 vLLM 0.27.0+,当前仅支持 NVIDIA Hopper 及更新 GPU,并提供 GB200 托盘 TP4 与 prefill/decode 分离部署配方。
两条路线目前并存:智谱自营推理由国产芯片集群承接,开源权重面向第三方的部署配方落在 NVIDIA 硬件上。vLLM 配方页是这批材料中少数不依赖官方口径的基础设施确认。
尚未对上的四组数字
把各方口径摆在一起,有四组数字对不齐。参数规模:晚点写 300B(称约为 GLM-5.3 的 40%),官方博客与推文为 320B,Hugging Face 权重页与 vLLM 配方均标 321B。
集群规模:官方博客"数万颗"与晚点"超 10 万张"相差一个量级,两者是否统计同一范围未说明。日流量:SemiAnalysis 称 100T/天,晚点称匿名测试期 5 天累计超 50T,时期与口径不同。供应商:华为、摩尔线程与海光出自知情人士,智谱未置评。
这些差异无法从现有材料判定孰是孰非。可以确认的是:开放权重已上线,OpenRouter 上已有 Hermes Agent、Claude Code 等实际调用,智谱官方、晚点与 SemiAnalysis 一致指向"国产芯片承载"。
规模数字本身,仍有待智谱或供应商给出可核对的明细。