AREX Feed Article
智谱 API 用户数逼近 700 万,新启用超 5 万块国产算力芯片
独家获悉,智谱 MaaS 开放平台注册用户已接近 700 万,相比 7 月初增长约 200 万。其中包括 2.3 万家企业客户,对标 Codex 的开发者产品 ZCode 上线仅 1 个月,用户突破百万。
与此同时,超过 5 万块国产算力芯片已经启用,支撑规模达 1 GW 的算力基础设施,以缓解日益增长的推理需求。7 月 31 日,智谱长期限售的 Coding Plan 在大幅涨价后开放购买,需求不减。
ARR 一年涨 15 倍,Coding Plan 从 20 元涨到 118 元
今年 2 月初 GLM-5 发布前,智谱 ARR 约为 1 亿美元。GLM-5 上线后短期内即翻倍,到现在 ARR 已较年初增长 15 倍。
一位投资人对《晚点 LatePost》透露,目前 ARR 已来到 20 亿美元,但智谱官方否认了这个数字。接近公司的人士表示,实际数字应该更高。若按 20 亿美元口径计算,注册用户当月平均在智谱开放平台花费约 160 元人民币。
7 月 31 日,长期限售的 Coding Plan 放开购买,Lite 版价格从此前的每月 20 元涨至 118 元。Coding Plan 本是早期吸引用户的策略,谁都没料到 token 需求会井喷。现在智谱需要优先保供 API,只能对个人用户提价。
即便如此,按输入、缓存命中、输出约 7:2:1 的比例计算,GLM-5.2 的混合价格约 8.8 元/百万 token,显著低于美国同性能模型。
据《晚点 LatePost》了解,智谱 API 毛利率在理想状况下、于自有算力设施上运转时可达 50% 到 60%。作为参照,SemiAnalysis 估计 Anthropic API 毛利率超过 80%,The Information 则报道 DeepSeek 的 API 毛利率约在 70% 到 80% 之间。
这些数字均未计入前期投入,而在大模型领域,前期投入才是大头:海量算力采购加上庞大的人员成本。
300 亿港元配售,一个下午认购完毕
7 月,智谱宣布新一轮港股配售,发生在基石投资人解禁的第二天,股价不降反升。一位接近智谱的人士透露,整个配售认购"一下午就完成",最终募资超过 300 亿港元。智谱公告显示,55% 用于研发,覆盖算力采买和人才队伍扩充。
在开源策略上,智谱在 上仍沿用最宽松的 MIT 协议。而据《晚点 LatePost》了解,不止一家厂商正在酝酿或推行把开源授权变成商业合同:开源版本是"残血"的,满血版只在官方 API 提供;年收入超 2000 万美元企业需单独申请授权;第三方托管定价不得低于官方 API,部分方案还要求分成,比例最高可超 30%。
智谱是中国最早喊出"模型即服务"的公司,MaaS 开放平台域名 bigmodel.cn 早在 2022 年 ChatGPT 发布前就已注册。
同样的卡,GLM-5.2 比 5.1 多跑 70% 的 token
物理硬件无法快速扩展,智谱的工程师转而聚焦在通过算法提升推理效率上,尤其是编程场景最疼的长程任务。过去智谱被认为在 Infra 上缺乏经验,过去半年,它用一连串成果追了上来。
7 月,智谱完成对中科加禾的收购,双方此前已联合办公数月。研究成果之一是通过分拆 KV 缓存,将单个推理服务吞吐随长程任务增长最高提升 132%。
另一项名为 ZCube 的推理网络架构方案,宣称可提升整个生产集群吞吐量高达 15%,同时降低交换机与光模块需求多达三分之一。
5 月下旬,智谱联合 TileRT 团队推出高速版 API,每秒生成 token 数达 400,约为常规 API 的 8 倍。TileRT 与 TileLang 来自同一团队,TileLang 正是梁文锋讲话中那个被认为有潜力瓦解英伟达 CUDA 护城河的编程语言。
GLM-5.2 的架构改动几乎全部围绕推理成本。IndexShare 通过复用稀疏注意力层索引器,把百万 token 场景下单位 token 计算量降低 2.9 倍。改进后的 MTP 草稿层接受长度提升 20%,生成速度快约两成。
后训练阶段重新采用 PPO 并配套 SAO 异步方法,行业同类方法通常在约 160 步崩溃,它稳定训练了 1000 步。自研框架 slime 则能在约两天内把十几个专家模型合并成一个。
最终结果是一张归一化吞吐图:以 GLM-5.1 处理 3.2 万 token 上下文为基准,20 万上下文长度下,GLM-5.2 的吞吐能力为 4.7 倍,GLM-5.1 仅为 2.77 倍,高出近 70%。
这也是目前模型公司共同的优化方向。Kimi 的 K3 更激进,把四分之三的注意力层改成了"线性注意力",这是一种"有损"的改动,换来缓存体积大幅减少、吞吐同步提高。一位投资人对《晚点 LatePost》表示,Infra 层优化将是未来一两年 AI 投资的重要主题,原话是:"模型能力趋同之后,谁能把同样的卡跑出更多 token,谁的账就更好看。"
Kimi 被挤爆、阿里涨 7%,智谱增速没受影响
智谱的增长并非以对手的萎缩为代价。7 月 16 日 Kimi 发布 K3,次日 API 因过载中断近六小时,Kimi 甚至停止了新用户注册。8 月 3 日阿里发布 2.4 万亿参数的 Qwen3.8-Max,港股当天涨 7%,市值重回 2.4 万亿港元。
但智谱的 API 用户增长和 ARR 增速在此期间几乎没有受到影响。
Anthropic 是这套剧本的原作者:年化收入从 2025 年底的 90 亿美元飙升至半年后的 500 亿美元,SemiAnalysis 测算 7 月已超 600 亿美元。除了编程场景需求跑通,Anthropic 连续推出超过 OpenAI 的领先模型被认为起到了重要作用。
智谱是第一个在中国把这套"前沿模型 + coding 场景"剧本跑通的公司。
但大厂的追赶不容忽视。阿里吴泳铭在 5 月财报电话会上表示算力投入将远超此前承诺的三年 3800 亿元。腾讯 2026 年 Q1 经营性资本支出同比增长 18%、环比增长 84%。字节则宣布不做蒸馏,短期内放弃快速追赶前沿模型,但它在视频模型上已拿出 SOTA 成果,对 Coding 的投入也在加码。
大厂只要赢一次,叙事就会改写
智谱和 DeepSeek 预计都将在 8 月发布新模型,战况会进一步升级。
独立模型公司的优势在于没有历史包袱,能更快跟上新技术。但这是一场关于速度的竞赛,大厂只要赢一次,叙事就可能重新改写。独立模型厂商至今仍困于算力瓶颈,有时甚至向潜在对手租用算力,而大厂在算力采购与人力成本上的优势是压倒性的。
商业模式本身也在快速变化。越来越多的企业开始搭建"内部路由",按任务复杂度组合不同模型。Palantir 们则在教育客户只用 API、不要使用模型厂商的更多工具。逻辑简单:模型最终会大宗商品化,数据和工作流才是企业最珍贵的资产。领先模型守住位置的时间越来越短,用户在多个平台之间自由迁移,几乎没有壁垒。
Coding 浪潮让独立模型厂商重新拿到了增长,但能否守住取决于持续领先的模型能力。智谱和 DeepSeek 的 8 月新模型发布,将是下一轮检验。