AREX Feed Article
GLM 5.3 编码能力创中文模型新高,与 Kimi K3 并列开源第一
KrASIA 于 9 月 1 日刊发特写《》(Z.ai 在企业 AI 领域落后之后如何翻身),把 Z.ai(原智谱 AI)在企业 AI 业务上的翻身,归因于 2025 年 5 月的一次战略决策:放弃分设垂直模型,改训一个融合推理、编码与 agentic(智能体)数据的单一大型模型。文章援引 36Kr 的报道称,这一路线的最新成果 GLM 5.3 在发布时创下中文模型编码能力新高,与月之暗面(Moonshot AI)的 Kimi K3 并列开源模型第一,与闭源旗舰 Claude Fable 5、GPT-5.6 Sol 处于同一性能档位。
排名的依据是 Artificial Analysis 智能指数(Intelligence Index)截至 8 月 27 日的快照。报道记录了 GLM 5.3 发布后第一个小时的情形:不到一小时,Z.ai 一名销售的手机和微信同时亮起,十几个客户追问 API 何时上线,还有人想起 Kimi K3 发布时的抢购,想提前锁定 Z.ai 的推理算力——「整个周末都是这样」。
发布一小时后,销售的电话先响了
周末过去,消息和电话没有停。GLM 5.3 的 API 原定 8 月 18 日上线,因故推迟,销售团队再次被淹没。这名销售转述一位客户的怒吼:「内部预算已经批下来了,开发和运维都准备好了。每延迟一天,我们就要多付几万块的管理费!」
需求的积累从今年 2 月就开始了。这名销售说,Z.ai 2 月发布 GLM 5,GLM 5.1 让公司更接近全球第一梯队,GLM 5.2 随后在多项基准上成为开源 SOTA(state-of-the-art,最先进)模型。报道随文刊出的指数快照如下。
图片来源:Artificial Analysis,经 KrASIA 转载。
2025 年 5 月:一场紧急战略会
2023 年大模型在中国兴起时,Z.ai 与主流叙事格格不入:公司 2019 年成立,很大程度上脱胎于清华大学,保留着明显的学术与实验室文化;商业化路径也与互联网公司不同,多年专注政府和企业客户的私有化部署。据 36Kr,公司数百名研究人员中超过 70% 是清华计算机系在读或已毕业的学生。
2025 年春节,DeepSeek R1 爆发,性能与 OpenAI o1 相当,价格只有其约三十分之一,直接冲击了定制部署这门 Z.ai 最重要的生意。一名负责商务交付的员工对 36Kr 说,假期里他一天要接五六通客户电话,大多在问「能不能部署 DeepSeek」;按保守估计,当时近 30% 的客户转向 DeepSeek,Z.ai 靠大幅折扣留住了一部分。
2025 年 5 月,Z.ai 召开紧急战略会,只有核心高管和少数股东参加,议题是下一代模型的方向。会议做出一个重塑研发路线的决定:放弃按文本、多模态、编码等能力分设垂直模型的做法,改训一个参数规模庞大、融合推理、编码与 agentic 数据的单一模型。
决定当时就有争议。一名知情人士对 36Kr 说:「不少股东反对继续扩大模型规模,因为需要的投入太高。」Z.ai 长期承受财务压力:2025 年财报显示净亏损 47.18 亿元人民币(约 7 亿美元),研发费用 31.82 亿元(约 4.72 亿美元),约为当年营收的 4 倍。融合多种数据的单一模型也与定制业务不匹配,一名负责 B2B 的员工说,同一模型跑在对话、图像、视频、编码等场景上,部署会更贵。
这个「三合一」模型最终成为 GLM 4.5,2025 年 7 月发布,比原定的 4 月推迟了三个月。据 36Kr,训练用了 15 万亿 token 通用数据加 8 万亿 token 编码、推理与 agentic 数据,总数据量接近同期同类模型的 1.5 倍。发布前几个月,研发人员几乎住在办公室:一名员工说,发布当天他半夜下班,第二天早上回来,算法团队还保持着他离开时的队形;市场团队有人熬到早上 8 点。
图片来源:36Kr,经 KrASIA 转载。
编码市场被低估了
GLM 4.5 成为 Z.ai 第一个在编码上建立口碑的模型,也让公司成为最早进入编码市场的中文基础模型厂商之一。这个方向最初不被看好:MiniMax 创始人闫俊杰(Yan Junjie)两年前问过 DeepSeek 创始人梁文锋(Liang Wenfeng)「你做不做 AI 编程」,梁文锋说不做。闫俊杰后来在一次活动上说,当时行业共识是中国会写代码的人只有一两百万,市场不够大;被低估的是 AI 编程能自己扩大市场,工具一旦实质改变软件工作的方式,服务两百万程序员的市场可能触达多得多的用户。
编码成为焦点,部分原因是用户需求。据 36Kr,Z.ai 研发团队反复讨论要贴近真实用户需求而非只盯榜单,算法团队大量依赖用户和客户反馈,被反复提起的需求是提升研发效率。GLM 4.5 发布后,有销售回忆大客户持续要求把模型接入程序员工作流;社交平台上开始有人把它称为「Claude 的平价替代」:部分评测中编码能力接近 Claude Sonnet 4,价格约为 Claude 的七分之一。
2025 年 9 月,Z.ai 推出 GLM Coding Plan,自称是中文基础模型厂商的第一个编程套餐,10 月推出企业版,同月发布针对编码强化的 GLM 4.6。创始人兼首席科学家唐杰(Tang Jie)在 2025 年初的一场活动上说:「DeepSeek 来了之后,聊天机器人的故事已经结束了。我们该想的是下一个赌注是什么。」这个赌注最终落在编码上。
GLM 5.2 之后:上市、万亿市值与翻倍的 ARR
2026 年 1 月,Z.ai 在港交所上市,成为全球第一家公开上市的基础模型公司。CEO 张鹏(Zhang Peng)给每位员工发了 200 元红包,庆祝只持续了一天:第二天 MiniMax 上市,首日大涨 109%,市值突破 1,000 亿港元(约 128 亿美元),接近 Z.ai 的两倍。一名投资人对 36Kr 说,当时 MiniMax 押注消费市场,在中国被认为更有想象空间;Z.ai 背着 B2B 和政府业务标签,「看起来没那么性感」。
图片来源:Z.ai,经 KrASIA 转载。
上市五个月后,市场叙事反转。6 月 13 日,Z.ai 发布 GLM 5.2:在 Artificial Analysis 总榜上排在开源模型第一,仅次于闭源的 Claude Fable 5、Claude Opus 4.8 和 GPT-5.5。客户支出随之而来。一名股东称,5 月公司 ARR(年度经常性收入)约 5~6 亿美元,年底预期 10~15 亿美元;据 36Kr,GLM 5.2 发布一个月后,ARR 在 7 月达到 10 亿美元,两个月内接近翻倍,年底预测上调至 25 亿美元。36Kr 还援引熟悉其财务状况的人士称,Z.ai 已成为按 ARR 计中国最大的模型开发商。Z.ai 未回应置评请求。
阿里云、火山引擎、小米和金山云都在向客户推 GLM 5.2,一名阿里云销售确认,到 7 月阿里云「直接向客户推荐 GLM 5.2」。云部署平台 Vercel 的监测显示,GLM 5.2 的使用量增速超过 2026 年发布的任何其他模型,超过了 4 月发布的 DeepSeek V4。股价同步上涨:GLM 5.2 发布后首个交易日涨约 32%,一周后市值突破 1 万亿港元(约 127.6 亿美元),报道称其市值一度达到 1.3 万亿港元(约 165.8 亿美元)。
定制交付的天花板与 MaaS 转向
今年早些时候,Z.ai 把模型即服务(MaaS)业务的优先级大幅提高,部分股东认为单靠定制化企业业务撑不起更高的估值。定制业务年增速约 1.5 倍,增长稳定但有明显天花板:每份合同高度定制,一名员工说,为了尽快拿到验收签字,「要替客户开会、帮忙做演示文稿,甚至去接客户的孩子」,人力消耗极大。
模型迭代速度让定制模式更被动:部署项目开工时领先的模型,几个月后实施完成时可能已经落后,追求灵活性的客户因此转向 MaaS。Z.ai 早在 2021 年就讨论过这种模式,当时认为应向 OpenAI 学习、重视 API 收费,但中国 MaaS 市场尚未成熟。五年后,张鹏把 Anthropic 定为对标。据 36Kr,Z.ai 的市销率是 Anthropic 的五倍多:若按同一市销率支撑 1 万亿港元市值,需要 487.8 亿港元(约 62 亿美元)的 ARR,而它的 ARR 才刚突破 10 亿美元。
编码之所以成为重心,也与公司气质有关。张鹏曾这样形容 Z.ai:「就像一个清华的工科男生,很聪明、很能干,你让他做什么他都能做得很好,但他就是提供不了多少情绪价值。」2024 年,Z.ai 与一家硬件厂商合作把 GLM 集成进产品,内测时员工输入「我有点难过」,模型回答:「把空调打开。」这种取舍体现在团队规模上:多模态训练团队只剩约十人,文本和编码团队约一百人。
一名前 Z.ai 算法研究员解释背后的机制:「每一个后训练目标都会挤占其他目标的能力。把编码能力设为训练目标,意味着训练数据要简洁、高精度、少废话,这与人们日常那种情感丰富的交流相悖。」GPT-5 和 DeepSeek V4 发布时都有用户抱怨「情商」随能力提升而下降;MiniMax 的 M3 发布后反响平淡,一名参与训练的算法研究员说其训练目标未能收敛,MiniMax 已于 6 月底解散后训练团队中的「泛娱乐组」,把资源转向推理与工作场景。
开源第一的位置只坐了一个月
GLM 5.2 在开源 SOTA 位置上坐了约一个月,7 月 17 日被月之暗面的 Kimi K3 取代;20 多天后,Z.ai 用 GLM 5.3 重回榜首。据 36Kr,与上一代相比,GLM 5.3 的提升主要来自后训练,而非扩大预训练参数规模;过去一个月里,月之暗面、DeepSeek 和阿里都发布了新的旗舰模型,参数规模约为 GLM 5.3 的 2~4 倍。
8 月 19 日,唐杰在 X 上发文阐述他对缩放定律(scaling law)的看法:模型能力不再简单由参数规模决定,模型开发越来越像一场受控实验,变量包括用多少数据、算力预算花在哪里、最终由谁在什么条件下运行模型。这套说法解释了 GLM 5.3 背后的工作方式。多名员工把这次翻身归因于「纪律性聚焦、避免重大失误、在关键阶段做对技术选择」;而对 Z.ai 而言,编码是在正确的时间把这些要素对齐的那项能力,更广泛的竞赛仍未落定。
本文事实均出自 KrASIA 特写及其转述的 36Kr 报道,相关数据与说法未经独立核实。
参考链接
- KrASIA:《》,2026-09-01