AREXOpen in interactive Feed

AREX Feed Article

智谱 ARR 一年涨 15 倍:700 万 API 用户、5 万块国产芯片与一场不能停的竞赛

August 11, 2026

《晚点 LatePost》8 月 10 日,智谱 MaaS 开放平台注册 API 用户已接近 700 万,较 7 月初净增约 200 万,其中包括 2.3 万家企业客户。对标 OpenAI Codex 的开发者工具 ZCode 上线仅一个月,用户突破百万。

收入端:今年以来,智谱 ARR 增长 15 倍。GLM-5 今年 2 月初发布前,这个数字约为 1 亿美元。发布后短期内即翻倍,而 Kimi K3 与阿里 Qwen3.8-Max 的相继发布,并未拖慢智谱的增长。

Anthropic 在美国趟出的"前沿模型 + 编程场景 = 收入火箭"剧本,正在中国被第一次完整复制。

从 GLM-5 前的 1 亿美元,到投资人喊出的 20 亿

智谱 ARR 的起飞轨迹几乎与 Anthropic 同构。

2026 年 2 月初 GLM-5 发布前,智谱 ARR 约为 1 亿美元。根据 Artificial Analysis 评测,GLM-5 发布时位居全球第四,仅次于 Claude 当时最先进的两款模型以及 OpenAI 的 GPT-5.2。发布后 ARR 短期内即翻倍。

此后增速并未放缓。有投资人向《晚点 LatePost》透露,目前 ARR 已来到 20 亿美元。智谱官方否认了这一数字。接近公司的人士则称,实际数字应该更高。若暂按 20 亿美元口径计算,近 700 万注册用户当月平均在智谱开放平台花费约 160 元人民币。

作为参照,Anthropic 年化收入在 2025 年底为 90 亿美元,半年后飙升至 500 亿美元。SemiAnalysis 测算显示,7 月已超过 600 亿美元。除编程场景需求跑通之外,Anthropic 连续推出超越 OpenAI 的领先模型起了关键作用。

智谱是第一个把这个剧本在中国复制的公司。7 月 16 日 Kimi 发布 K3,次日 API 因过载中断近六个小时,Kimi 甚至停止了新用户注册。8 月 3 日阿里发布 2.4 万亿参数的 Qwen3.8-Max,港股当天涨 7%,市值重回 2.4 万亿港元,从 6 月低点算起反弹超过四成。

港股配售 300 亿港元,一个下午就完成

7 月,智谱宣布新一轮港股配售,时机落在基石投资人港股解禁的第二天。通常解禁日股价承压,智谱股价不降反升。

据一位接近智谱的人士透露,整个配售认购一个下午就完成了,最终募资超过 300 亿港元。根据智谱公告,55% 用于研发,涵盖算力采买和人才队伍扩充。

智谱是中国最早喊出"模型即服务"的公司,MaaS 开放平台域名 bigmodel.cn 早在 2022 年 ChatGPT 发布前就已注册。但它在更早以更合适的价格锁定更多算力这件事上失了先手。现在算力就是一切。

5 万块国产芯片与 Infra 效率的追赶

7 月 21 日,市场传出智谱已建成规模 1GW 的国产 AI 算力基础设施。据《晚点 LatePost》了解,已有超过 5 万块国产算力芯片实际启用,用于承接不断增长的推理需求。

算力紧缺逼出了另一条路:Infra 效率优化。

过去智谱在 Infra 上不被看好,但 GLM-5 的先发优势给了它弥补短板的窗口。7 月,智谱完成对国产 AI 异构算力软件公司的收购。后者源自中科院计算所编译实验室,双方此前已联合办公数月。

智谱在中写道,一个 Agent 干活时平均往模型里塞 7 万多 token 的上下文,远超日常聊天。通过分拆 KV 缓存,智谱与中科加禾的研究成果可将单个推理服务吞吐随长程任务增长最高提升 132%。另一项名为 ZCube 的网络架构方案,宣称能提升整个生产集群吞吐量 15%,同时降低交换机与光模块需求多达三分之一。

5 月下旬,智谱推出高速版 API,每秒生成 token 数达 400,较常规服务提速约 8 倍,官方称其"刷新当前全球大模型厂商 API 的速度上限"。这项成果来自与 TileRT 团队的合作,后者与 TileLang 出自同一团队,即梁文锋内部讲话中那个被认为有潜力瓦解英伟达 CUDA 护城河的编程语言。

GLM-5.2 的架构改动几乎全部围绕推理成本设计。IndexShare 通过复用稀疏注意力层的索引器,把百万 token 场景下单位 token 计算量降低 2.9 倍。改进后的 MTP 草稿层接受长度提升 20%,生成速度快约两成。后训练阶段重新采用 PPO,配套名为 SAO 的异步方法:行业方法通常在约 160 步就崩溃的地方,它稳定训练了 1000 步。自研框架 slime 能在约两天内将十几个专家模型合并为一个。

以 GLM-5.1 处理 3.2 万 token 上下文时的吞吐为基准,20 万上下文长度下,GLM-5.2 的吞吐能力为 4.7 倍,而 GLM-5.1 仅为 2.77 倍,高出约 70%。

算力吃紧的另一面是定价权。7 月 31 日,智谱放开了长期限售的 Coding Plan,但 Lite 版月费从推出时的 20 元涨至 118 元,涨幅近 6 倍。Coding Plan 本是早期吸引用户的策略,如今 token 需求井喷,智谱优先保供 API,只能对个人用户提价。

即便如此,按输入、缓存命中、输出约 7:2:1 的价格计算,GLM-5.2 的混合价格约 8.8 元/百万 token,显著低于美国同性能模型。

API 毛利率也在改善。SemiAnalysis 估计 Anthropic API 毛利率超 80%,The Information 报道 DeepSeek 约 70%-80%。据《晚点 LatePost》了解,智谱 API 毛利率在理想状况下,于自有算力设施上可达 50%-60%。但这些数字不含前期投入。海量算力采购和庞大人员成本,才是大模型生意烧钱的大头。

一位投资人对《晚点 LatePost》表示,Infra 层优化将是未来一两年 AI 投资的重要主题:"模型能力趋同之后,谁能把同样的卡跑出更多 token,谁的账就更好看。"

Kimi 和阿里都在涨,增量市场里没有输家

7 月中旬 Kimi 发布 K3 时,智谱 API 用户增长几乎没有受到影响,ARR 增速也未放缓。《晚点 LatePost》的结论直白:每一个模型厂商的增长,都不是以别家的萎缩为代价。

这是一块还在快速膨胀的蛋糕。编程需求的爆发才刚刚开始,AI 在生产力场景的扩散程度还不够高。token 是一个纯粹的增量市场。

这让各家有了提价的底气。智谱 Coding Plan 涨价近 6 倍仍然供不应求。Kimi 更激进,K3 模型 API 输出价定为每百万 token 15 美元,与 Claude Sonnet 5 的标准定价完全一致。根据智谱 2025 年年报,定价提高一倍,调用量反而涨了八倍。

但定价权的前提是模型有区别。智谱在 GLM-5.2 上仍沿用 MIT 协议,然而不止一家厂商正在酝酿把开源授权变成商业合同:开源版提供"残血"能力,满血版只在官方 API;年收入超 2000 万美元的企业需单独申请;第三方托管服务定价不得低于官方 API,部分方案还要求分成,比例最高超 30%。

一个反例来自 DeepSeek:许多第三方提供的 DeepSeek 模型效率无法达到官方宣称的程度,而 DeepSeek 已是相对最开放的大模型厂商。模型的结构、训练过程和推理效率正日益紧密地耦合在一起,第三方只能在模型之外做优化。

大厂只需要赢一次

大模型的机会似乎正在重新回到创业公司手里。半年多前还难以想象:Kimi 估值徘徊在 30 亿美元,智谱和 MiniMax 的招股书难以论述商业模式的合理性。一家 85% 收入来自本地化部署交付,一家二十多亿元收入对应十几亿元亏损。C 端更是与独立模型厂商无关,豆包砸出了国民级用户量,但字节每天以千万计地亏钱,免费换规模的移动互联网打法找不到盈利闭环。

窗口期来自编程。Coding 浪潮把按 token 计费的需求真正引爆。而大厂在长达半年的时间里拿不出一个第一梯队的 coding 模型。字节甚至宣布不做蒸馏,等于亲手放弃了短期内快速追赶前沿模型的机会。

但窗口期不会一直敞开。

阿里巴巴吴泳铭在 5 月财报电话会上表示,对算力中心的投入规模将远超之前承诺的三年 3800 亿元。腾讯 2026 年第一季度经营性资本支出同比增长 18%,环比增长 84%。与之对照,独立模型厂商至今还囿于算力瓶颈,有时甚至向潜在对手租用算力。

大厂只要赢一次,整个叙事就可能重新改写。字节在视频模型上已经拿出了 SOTA 成果,如今对 Coding 的投入肉眼可见地坚定。

更深的挑战来自商业模式的底层。Palantir 们正在教育企业客户只用 API,不要触碰模型厂商提供的更多工具。逻辑很简单:模型最终会大宗商品化,数据和工作流才是企业最珍贵的资产。把业务数据源源不断喂给模型厂商,等于出资供养一个终将替代自己的智能系统。

大模型 API 的商业模式目前一条壁垒都不满足。领先模型守住位置的时间越来越短,用户在多个平台间自由迁移,几乎没有切换成本。

智谱和 DeepSeek 预计都将在 8 月发布新模型。窗口还开着,算力依旧紧缺。眼下可以确定的只有一件事:排行榜以越来越快的速度刷新,这是大模型玩家们目前能做的唯一应对。

参考链接