AREX Feed Article
Cognition 发布 SWE-2:基于 Kimi K3 后训练,称在主流评测上与前沿模型持平、成本最高降低 70%
9 月 10 日,Cognition 在其官方 X 账号发布软件工程模型 SWE-2,称这是公司迄今「最接近前沿」的模型:在主流评测上与近期前沿模型得分持平,成本最高可低 70%。称,这次把强化学习(RL)扩展到了数万亿参数的规模,并用改进后的训练配方在能力与成本两端推动 Pareto 曲线(成本与性能之间的权衡曲线)。
称,SWE-2 以 Kimi K3 为基座做后训练;称,这是公司第一个支持 effort 档位(推理强度档位)的模型。称,模型发布当天在 Devin 桌面端与 CLI 上线,接下来一个月对 Pro、Max 与 Teams 订阅者免费。
FrontierCode 50.0%:差 Fable 5.1 不到 1 分,成本低 64%
Cognition 的给出了覆盖四项评测的对比表。FrontierCode 1.1 Main 一行是:SWE-2 50.0%,Fable 5.1 50.9%,GPT-6 Astra 53.3%,Grok 4.6 48.0%,GPT-5.6 Sol 47.5%,SWE-1.7 42.0%,基座 Kimi K3 44.2%。博客称,SWE-2 与 Fable 5.1 相差不到 1 分、成本低 64%;在 FrontierCode 1.1 Main 与 DeepSWE 1.1 上,它得分与成本同时优于 SWE-1.7 和 Grok 4.6,以低得多的价格追平 GPT-5.6 Sol 与 Fable 5 系列,与 GPT-6 Astra 相差几个百分点、成本约为其四分之一。
另外两项:DeepSWE 1.1 上 SWE-2 得 73.0%;Terminal-Bench 2.1 上得 92.8%,是表内该行的最高分。
effort 档位:一次 RL 训练同时调整三档
SWE-2 的 effort 档位分三档:medium、high、max。为同时训练这些档位,公司对 length penalty(长度惩罚)方案做了重大改进;训练博客给出的机制是:在单次 RL 训练中为每个档位施加一个线性成本惩罚,惩罚系数对准基座模型在该档位 Pareto 前沿的局部斜率,使沿曲线移动近似不改变奖励,训练因此把整条曲线向上推、同时保持其形状。公司称,结果是 medium 档同时变得更便宜、更聪明,max 档学会使用更多 token 与轮次来拿最高分。
博客还提到,SWE-2 建立在 SWE-1.7 的训练基础设施与配方之上,并公开了自 SWE-1.6 起使用的长度加权奖励基线,称它能在不增加成本的前提下降低梯度方差、明显稳定训练。
基座 Kimi K3:2.8 万亿参数,后训练再涨 5~6 分
SWE-2 的后训练基座是 Kimi K3:一个 2.8 万亿参数、已经历过大量智能体编程(agentic coding)强化学习的模型。官方推文称,这「证明我们的 RL 配方在更强的基座模型上仍能继续扩展」;博客称,RL 在 K3 上仍找到可观空间,在多项基准上带来 5~6 分增益,FrontierCode 1.1 Main 从 K3 的 44.2% 提到 50.0%,并把 K3 的成本与性能前沿整体向前推进。
工程侧也做了一批调整。所用基座的参数量接近 SWE-1.7 基座的 3 倍,公司称借助 NVFP4/FP8 内核与量化感知训练降低了整体内存占用,并把训练与推理之间的不一致压到比 SWE-1.7 更低、吞吐相当;RL 推演环节加入预填充延迟器,把邻近请求攒批处理,每 GPU 吞吐与单请求吞吐提高 10~20%;用 SpecForge 训练的新草稿模型把推测解码(speculative decoding)的接受长度提升 15%,并在训练中在线更新草稿模型以跟上策略变化。数据侧,RL 环境数量增至三倍,新增指令跟随类任务,并用 SWE-2 的历史检查点迭代加固数据验证器,以抑制奖励作弊(reward hacking)。
更聚焦的探索:少 58% 轮次、省 81% 成本
给出效率数字:在 FrontierCode 1.1 Main 上,SWE-2 medium 档得分高于 SWE-1.7,平均少用 58% 的轮次、成本低 81%。公司把原因归结为探索方式的变化:SWE-2 更快判断代码库里哪些部分真正相关,更早开始动手;博客称 medium 档做出第一次实质性修改的中位步数是 18 步,SWE-1.7 是 48 步。此前 SWE-1.7 因在简单任务上过度探索、过度思考收到过用户反馈。
博客列出的行为变化还有:更端到端的测试覆盖;在用户设定的边界内更愿意绕路,例如一次所需的 MCP 集成不可用,SWE-2 用已有的 Slack 频道历史重建了数据;以及验证纪律,被质疑时重新推导结论、用运行产物取证,而不是复述主张。档位之间也有差异:medium 更快进入执行,high 与 max 在复杂任务上规划与探索更多。
把 SWE-2 称为公司迄今最强的软件工程模型、具有「市场领先的性价比」,并称 Cognition 团队自己用它做功能开发、调试和新颖数学的复杂可视化。博客称,SWE-2 也在陆续推送到 Devin Web 与 Fusion。
自报口径与 Terminal-Bench 4 的落差
以上评测、性能与成本数字都来自 Cognition 的推文与博客,属于公司自报口径。博客的方法说明称,每个模型与基准的组合优先采用公开结果;没有公开结果的,由其内部评测框架运行,并使用各模型主要适配的运行框架,每个模型取各推理档位中的最好成绩。
博客还包括可信度评测:在 145 个政治敏感问题上的宣传与审查测试中,SWE-2 总体通过率 98.0%(英文 99.8%、简体中文 95.2%、繁体中文 99.1%)。
同一张基准表也给出了方向相反的一组数字。Terminal-Bench 4 一行:SWE-2 27.3%,Fable 5.1 55.8%,GPT-6 Astra 57.9%,GPT-5.6 Sol 37.3%;SWE-2 比自家 SWE-1.7(7.6%)与基座 Kimi K3(21.5%)高出一截,但比 Fable 5.1 与 GPT-6 Astra 分别低 28.5 与 30.6 个百分点。
参考链接
- Cognition 官方发布帖(主帖):
- Cognition 推文(Kimi K3 基座):
- Cognition 推文(effort 档位):
- Cognition 推文(效率数据):
- Cognition 推文(定位与内部使用):
- Cognition 推文(上线与免费窗口):
- Cognition 训练博客《Introducing SWE-2: Pushing the Pareto Frontier》: