AREX Feed Article
知乎 Frontier 拆解 GLM-5.3:基座未换,长程 Agent 基准上赢过更大的 DeepSeek-V4-Pro
知乎官方出海账号 8 月 21 日发布分析线程《GLM-5.3: When Better Sandboxes Matter More Than a Bigger Base Model》,转述知乎答主酱紫君对智谱 GLM-5.3 的解读:GLM-5.3 沿用了 GLM-5.2 的基座模型,官方宣称的提升全部来自扩展后训练;线程给出的对比数据显示,GLM-5.3 在 DeepSWE(66.9 对 62.7)、CyberGym(84.5 对 83.3)、Agents' Last Exam(28.5 对 25.7)三个长程 Agent 基准上,都超过了它口中"大得多"的 DeepSeek-V4-Pro-0813。线程还把智谱的 SAO(Self-Adaptive Optimization)机制解释为一种类似蒙特卡洛树搜索(MCTS)的反事实分支评估,并据此提出一个框架性判断:预训练扩展的是 token,Agent 后训练扩展的正在变成可执行环境,作者称之为"沙盒扩展定律"(Sandbox Scaling Law)。
这些内容属于二手分析。三组对比数字出自知乎答主酱紫君的答案,线程自称转述;"反事实分支"的解读与沙盒扩展定律的框架,在智谱官方技术报告和官方文档中没有对应表述。
基座没换,66.9 分的 DeepSWE 从哪来
酱紫君原本预期 GLM-5.3 会走向更新、更大的架构。线程转述称,智谱没有换基座,而是把资源集中在强化学习、更长的训练和更多样的环境上。这与智谱官方口径一致:8 月 14 日发布的开篇写道,GLM-5.3 使用与 GLM-5.2 相同的基座模型,"所有收益都来自后训练"("every gain comes from post-training")。给出的具体提升:内部基准 Z.ai Code Bench 较 GLM-5.2 提升 50%,Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 涨到 28.5。
线程重点转述的三组对比值,同样出现在智谱官方技术报告的完整基准表里:表中 DeepSeek-V4 Pro-0813 一栏的 DeepSWE v1.1 为 62.7,CyberGym 为 83.3,Agents' Last Exam(ALE-CLI)为 25.7。答主引用的数字能在官方自评表里查到出处;"参数扩展仍然重要,后训练或许能弥合那些曾经被认为必须靠更大模型才能拉开的差距"这个结论则是答主自己的判断,线程用 provocative(挑衅性)来形容它。官方完整表中双方并非全面领先:NL2Repo(58.0 对 61.1)和 Toolathlon Verified(73.0 对 74.1)两项,DeepSeek-V4 Pro-0813 反而更高。线程文末附上了。
78 步正确探索,第 79 步一个笔误就归零
线程先用一个具体场景说明长程 RL 的问题在哪:一个 DeepSWE 或 CyberGym 任务可能需要 30 到 80 轮交互;模型可以花 78 步正确地在仓库里探索、定位 bug、理解架构,第 79 步敲错一个字符,最终测试失败,环境返回的奖励是零。按线程的说法,传统 PPO 或 GRPO 会把整条轨迹都惩罚掉,有价值的调查和正确的中途决策被当作失败的一部分;久而久之模型会变得保守,回避困难探索、消耗更多 token、难以从长任务里学到东西。
SAO 的两种讲法:论文定义与类 MCTS 解读
线程给出的解法是 SAO。它的描述是:系统可以保存一个中间状态,从那里采样替代续写(alternative continuations);如果从第 78 步出发的许多条续写都成功,那么这一步大概是有用的,哪怕原始轨迹后来失败了。SAO 因此能保护早期有价值的动作免受负梯度,把惩罚集中在轨迹真正出错的地方,形成一种不需要人工为长软件工程过程逐动作打分的局部信用分配。线程自己把这种思路标注为"类似蒙特卡洛树搜索"(an idea resembling Monte Carlo Tree Search)。
这是答主的解释框架,不是智谱官方或论文的口径。SAO 论文《Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning》(,2026 年 7 月 8 日)对 SAO 的定义是"单 rollout 异步优化":用单条 rollout 采样替代 GRPO 的组内采样,配合 value model 训练和严格的双侧 token 级裁剪,解决异步 RL 的 off-policy 与稳定性问题;论文称该方案已部署在 GLM-5.2(750B-A40B)的 Agent RL 管线中。线程发布前一天,Z.ai 的 Zixuan Li 在 ,口径相同:SAO 稳定训练 1000 步,在 agentic coding 与推理基准上持续超过 GRPO 变体。Zhihu Frontier 自己在 时,讲的也是"单 rollout 异步优化 + token 级裁剪 + Skip-Observation GAE"。对照下来,"反事实分支评估"是酱紫君对同一机制给出的新解读;连缩写展开都不一样,论文和 Zixuan Li 用 Single-Rollout Asynchronous Optimization,线程则写作 Self-Adaptive Optimization。在官方技术报告和文档中,SAO 只被放在"GLM-5.2 引入的强化学习策略"框架下描述,没有反事实分支评估的表述。
反事实分支很贵,沙盒成为新的扩展资源
线程指出,反事实评估的成本很高:每一个中间分支都可能需要另一个可执行环境、仓库状态、测试套件和一次 rollout。这正是答主把 GLM-5.3 称为"沙盒扩展定律"演示的原因。智谱同时扩大了长程环境的数量与多样性,其开源框架 slime 把三类负载异步拆开:模型生成与 rollout、沙盒执行与验证、参数更新。组件之间不必互相等待,GPU 可以继续生成和训练,较慢的环境还在跑测试。
官方博客对 slime 的描述与此吻合:它是面向 RL 扩展的开源后训练框架,训练侧用 Megatron、rollout 侧用 SGLang,训练、rollout 与数据缓冲放在同一条 dataflow 上,沙盒、验证器、长程环境作为数据生成接入,无需改动训练循环;针对长程 coding RL 的系统优化把端到端训练吞吐提升了 2.3 倍以上。官方博客还交代了环境质量的控制流程:研究智能体从真实工作收集任务模式并转成可运行的长程环境,评审智能体(judge agent)实际试做每项任务以确认可解;验证器在看不到参考解法的情况下生成,求解轨迹被用来发现并堵住奖励捷径,只有通过 oracle、空操作与未解决状态检查的验证器,其二元奖励才用于训练。官方同时承认,这些流水线目前仍需要较多人工参与,环境生成与验证的自主化是下一阶段的重点。
从孤立漏洞到多阶段利用链,网络安全为什么跟着涨
线程的第五个观察是编码与网络安全在同步变强:智谱在后训练中加入了漏洞发现数据与环境,模型不只是更擅长找出孤立缺陷,而是开始把它们串成连贯的多阶段利用计划。线程给出的解释是两者共享底层技能:理解陌生仓库、追踪隐藏状态、使用工具、提出假设并用可执行反馈修正,一个足够丰富的沙盒能通过后果教会模型所有这些。
官方数字支撑了这一趋势:CyberGym 上 GLM-5.3 得 84.5%,高于 GLM-5.2 的 77.2%,官方称是该基准当前最佳,超过 Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%);ExploitBench 上 54.4% 对 24.4%,翻了一倍多;ExploitGym 两小时完成 105 项、六小时 130 项任务,GLM-5.2 分别是 29 和 39 项。把模型放到真实代码库上,经专家复核、筛选与去重后,共在 269 个项目中找到 2,436 个漏洞,其中 1,097 个为中高危。
线程最后引用了 AlphaZero 的类比:一旦环境与验证器足够可靠,模型可能越来越多地通过类似自我对弈的探索直接发现策略,而不是从人类轨迹起步。线程自己标注,"这仍是预测,不是已被证明的结果"("This remains a prediction, not a demonstrated result")。它由此给出的远期判断是:未来 AI 生成的代码可能不只因为数量多而难以审查,其底层工程策略对人类开发者会越来越陌生。
第一轮反驳:沙盒多不等于失败模式多
线程发布后,评论区已经出现针对"沙盒扩展定律"的具体反驳。账号 TeqVolt 在里写道:沙盒扩展只有在环境带来新信号时才有回报,"一千份相同仓库的副本只是在重新训练同一种分布"("A thousand copies of the same repo just re-trains one distribution"),关键数字不是跑多少个沙盒,而是它们能产生多少种不同的失败模式。另一位用户 对 SAO 一节反应强烈,称"一条大部分正确却仍被当作单个失败样本处理的长轨迹,这种世界必须被摧毁"。截至 8 月 21 日 12:31(UTC)抓取时,这条线程累计约 1,560 次浏览、31 个赞、12 次收藏,互动并不算多。
落到事实层面:三组对比数字能在智谱官方自评基准表里查到出处,但"反事实分支评估"的 SAO 解读与沙盒扩展定律的框架,在官方技术报告和文档里都没有对应表述,线程中也没有任何第三方复现的信息。目前能对照的,是论文给出的定义:单 rollout 异步优化。
参考链接
- _