AREX Feed Article
GLM-5.3 与 GLM-5.2 同基座同参数:jietang 称全部增益来自一个月 RL 后训练
8 月 19 日,Z.ai 创始人、清华大学教授 ()在 X 发布长文《Thoughts About Scaling Law》,把 8 月 14 日发布的 GLM-5.3 定义为一次受控实验:它与 GLM-5.2 使用相同基座、相同架构、相同总参数与激活参数,唯一变量是一个月来在长程环境(long-horizon environments)上的扩展与 RL 后训练。"The gains are not marginal."(收益不是边际的)他在文中写道。截至本稿核验时(发布约 5 小时),这条已获约 15.5 万次浏览、1900 余次点赞和 255 次转发。
这个定义比 Z.ai 官方的口径更进一步。Z.ai 8 月 14 日的当时只写了 "Scaling post-training is all we did for GLM-5.3"(为 GLM-5.3 我们只做了后训练扩展),并称模型与 GLM-5.2 共用同一基座、全部增益来自后训练;jietang 的长文补上了架构、总参数与激活参数完全相同这一层,把"参数之外还有 scaling 维度"落实为一次可检验的实验。他还在文末预告,下一步可能转向 mid-training、pre-training(预训练)等其它维度。
参数不是唯一刻度:从 Kaplan 到 Chinchilla 再到推理成本
jietang 开篇先回答了"为什么不能只问参数":每次模型发布都以"多少参数"收尾,但参数数量只有与另外三个问题放在一起才有意义:有多少训练数据、算力打算花在哪里、谁在什么条件下运行模型。他说这是行业"用惨痛代价学到的"(learned this the hard way)。
他的梳理从 2020 年的 Kaplan et al. 开始:那篇论文拟合出的指数告诉所有人参数要长得比数据快,比例约为 2.7:1,行业照做了,GPT-3、Gopher、MT-NLG 都是这么来的。事后看,万亿参数那一轮是"整个领域一起走、又一起折返的弯路"(a detour the whole field took together and then reversed)。到 2022 年,Hoffmann et al. 用四百多个模型重做实验,得出计算最优配比约为每个参数 20 tokens,且算力充足时参数与数据应同速增长而不是越拉越远。早期拟合的误差随算力每提升一个数量级而累积,所以那一代最大的模型恰恰是算力配置最失衡的一批。
Chinchilla 也不是终点。jietang 指出,它优化的是"训练一次、拿去评测"的模型,而今天的模型一天被调用数十亿次,推理成本主导生命周期总成本;把推理计入目标函数后,最优解移向更小、训练更久的模型,即刻意过训练(deliberate over-training)。Llama-2-7B 和 Gemma-2-9B 分别按约 290 和 889 tokens/参数训练,走的就是这条路。
MoE 把容量与推理拆开:总参数管知识,激活参数管推理
稀疏化再次移动了目标。jietang 说,在 MoE 模型里必须把两个量分开:总参数大致决定模型能装下多少东西,即知识、事实、长尾信息;激活参数与有效深度(effective depth)大致决定它能想多远、能在一条因果链上走多少步而不散架。稠密模型的 20:1 配比不能直接迁移。
而且这个比值根本不是单一数字:Roberts et al. (2025) 发现最优 tokens-per-parameter 因任务而异,记忆类任务偏爱更多参数,推理类任务偏爱更多数据。后续 MoE 研究还观察到,固定 TPP(每参数 token 数)时把总参数推高反而损害推理,激活更多专家则稳定地提升推理。
为什么这对 Z.ai 正在做的事重要,jietang 给出了具体答案:"发现漏洞不是检索问题"(Finding a vulnerability is not a retrieval problem)。它不来自背下更多 CVE,而来自把一条二十步的推理链完整走到头而不丢线索,"这种能力不在总参数里"。Z.ai 博客给出了对应的结果:随着后训练扩展,网络能力(cyber capability)发展快于预期,越往利用链(exploitation chain)上端增益越大。按博客自报的数据,CyberGym 从 GLM-5.2 的 77.2 升到 84.5,ExploitBench 从 24.4 翻倍到 54.4,ExploitGym 在两小时/六小时预算下从 29/39 个任务升到 105/130。
一个月长程环境与 RL:Terminal-Bench 从 4.6 到 28.3
jietang 把 GLM-5.3 称作对这一判断的受控实验:"Same base, same architecture, same total and activated parameters as GLM-5.2. One month of scaling long-horizon environments and RL."(与 GLM-5.2 相同基座、相同架构、相同总参数与激活参数。一个月的时间用于扩展长程环境与 RL。)
这一个月具体做了什么,博客有更细的描述:环境扩展从"像编码练习"转向"像真实的专家工作单元",有的任务相当于资深工程师数天的工作量;团队用流水线端到端合成环境,研究 agent 从真实工作中收集任务模式,生成带多步依赖和隐藏状态的可运行长程环境,再由 judge agent 试做一遍验证任务确实可解。验证器在看不到参考答案的情况下合成,并用 solver 轨迹发现和封堵奖励捷径。
公开基准上的数字(均为 Z.ai 自报):Terminal-Bench 3.0 从 4.6 升到 28.3,DeepSWE v1.1 从 46.2 升到 66.9,Agents' Last Exam 从 23.8 升到 28.5。自家 Z.ai Code Bench 上,Max effort 下 GLM-5.3 以约 7.5 万输出 token 达到 34.5%,GLM-5.2 用约 9.6 万 token 只有 23.4%;High effort 下 GLM-5.3 以约 5 万 token 达到 31.4%,超过 Claude Opus 4.8 的 29.5%(12 万 token)。同一基座、只加后训练,带来的不只是分数,还有 token 效率。
这套训练跑在 Z.ai 开源的后训练框架 slime 上(训练侧 Megatron、推理侧 SGLang),沿用了 GLM-5.2 引入的 SAO 等 RL 策略。博客称,针对长程编码 RL 任务的系统级优化把端到端训练吞吐提升了 2.3 倍以上,这正是"一个月能扩这么多环境"的前提。
这次拧后训练,因为它的余量最大
jietang 在文中给出一个阈值判断:总参数的作用到某个点为止,即"足够装下世界"(enough to hold the world);之后的额外能力来自别处:每次前向计算的有效深度,"尤其是后训练"(above all post-training)。
为什么这次先拧后训练,他的解释很直接:"Well, scaling has more than one dial. We turned the post-training one this time because it had the most slack left in it — not because the others are finished."(scaling 不止一个旋钮。这次拧后训练,是因为它剩下的余量最大——不是因为其它维度已经到头。)基座模型规模、预训练数据、每次前向的算力"都还在桌上"。这个方向他此前就表露过:6 月 24 日,GLM-5.2 发布约一周后,他曾发推称。
这场实验给他的结论是:旋钮不必一起拧(the dials do not have to be turned together),"下一次值得拧的,很少是上一次值得拧的那个"。他明确说 scaling 没有结束:"Next time, maybe mid-training, pre-training, and even more."(下一次,也许是 mid-training、pre-training,甚至更多。)
"同基座同参数"的说法有一个可被外部核验的时间点:博客称权重将在发布后两周开源,待安全评估与加固完成后。届时社区可以直接比对 GLM-5.3 与 GLM-5.2 的基座是否真的相同。
「两个版本只能证明后训练有余量」:社区的三点疑问
这条长文发布后,中文 AI 社区很快有了成体系的重述与质疑。AI 内容创作者(约 6.9 万粉丝)发长帖把 GLM-5.3 称作"一次控制变量实验",并总结 jietang 的区分:总参数量大致决定模型装下多少知识,激活参数和有效深度决定长程推理能力,"大模型到底有多聪明,早就没法被一个总参数量概括了"。
更有保留意见的是 AI 独立开发者、ReddTrends 创始人 。他认同三个判断(单独比较参数量意义不大、计入推理成本后更小更久的训练更合理、MoE 已把模型容量与单次实际计算量分开),但保留了三点疑问:总参数是否存在"足以容纳世界"的通用阈值,"目前没有可测量的定义";"总参数负责知识、激活计算负责推理"更像工程近似,而非严格机制;以及最关键的一条:"两个模型版本只能证明后训练有余量,还不足以拟合一条可外推的新 Scaling Law"。