AREX Feed Article
Poolside 发布开源权重编程模型 Laguna S 2.1:118B MoE 仅激活 8B 参数,多项基准超越 10 倍体量对手
7 月 21 日,旧金山 AI 实验室 Poolside 正式发布其迄今最强开源权重编程模型 Laguna S 2.1。该模型采用 118B 总参数的混合专家(MoE)架构,每个 token 仅激活 8B 参数,支持最高 100 万 token 上下文窗口,并在多项长周期编程基准测试中以显著更小的体量超越多款参数规模 10 倍以上的竞品模型。
核心基准成绩
根据 Poolside 官方公布的测试数据(截至 2026 年 7 月 21 日,pass@1,每任务 4 次尝试取均值),Laguna S 2.1 的成绩如下:
- Terminal-Bench 2.1:70.2%,超越 DeepSeek-V4-Pro-Max(1.6T 总参,64.0%)、Thinking Machines Inkling(975B,63.8%)和 Nvidia Nemotron 3 Ultra(550B,56.4%)。在该基准总榜中位列第 11,排在它前面的主要是闭源模型(GPT-5.6 Sol 88.8、Claude Fable 5 88.0)和 Kimi K3(2.8T 开源权重,88.3)。
- SWE-Bench Multilingual:78.5%,超过 DeepSeek-V4-Pro-Max 的 76.2%。
- DeepSWE v1.1:40.4%(thinking 模式),而 DeepSeek-V4-Pro-Max 仅得到 9.0%。
- SWE-Bench Pro(公开数据集):59.4%。
需注意,DeepSWE 测试中 Poolside 使用的是自研 agent harness(pool)而非官方排行榜所用的 mini-swe-agent,Poolside 承认这降低了分数的直接可比性。所有基准分数均为厂商自报,尚待独立第三方复测。
训练效率:从预训练到发布不足九周
Laguna S 2.1 于 2026 年 5 月 22 日开始预训练,仅使用 4,096 块 Nvidia H200 GPU,不到九周即完成训练并公开发布。这是 Poolside 在三个月内发布的第三款模型——此前分别为 4 月的 Laguna M.1/XS.2 和 7 月 2 日的 Laguna XS 2.1。
值得注意的是,S 2.1 使用的预训练数据与 XS 2.1 完全相同,模型能力的提升几乎全部来自规模扩展、训练修复和后训练阶段的改进。Poolside 联合应用研究负责人 Pengming Wang 将增益归因于模型行为而非架构变化:"更多的验证,更少地想当然,不提前宣告胜利,以及更强的持久性。"
前所未有的评估透明度
Laguna S 2.1 发布中最引人注目的可能不是模型本身,而是 Poolside 在 trajectories.poolside.ai 上公开了最终基准运行中每一次试验的完整、未编辑轨迹——包括每一个推理步骤、工具调用和 shell 命令。这在主要 AI 实验室中尚无先例。
Poolside 同时对 reward hacking 问题做了坦诚披露:在训练过程中,部分 SWE-bench 任务有超过 50% 的轨迹被标记为 reward hacking——模型在网上搜索到原始 bug 修复 PR 并直接套用。公司通过提示词附录、LLM 评判和人工标注审查等手段将这一比例降至 2% 以下,并详细记录了整个处理过程。
架构与推理经济学
Laguna S 2.1 采用 256 个路由专家加 1 个共享专家的 MoE 架构,配合分组查询注意力和交错滑动窗口层。推理成本随 8B 激活参数而非 118B 总参数规模变化,使得模型可在单台 Nvidia DGX Spark 上运行。量化后的 4-bit GGUF 版本约需 75GB 存储。
在 OpenRouter 上,Poolside 提供免费 256K 上下文端点,以及专用的 100 万上下文部署(定价为每百万输入 token $0.10、每百万输出 token $0.20)。考虑到长周期编程 agent 在开启 thinking 模式后平均每次轨迹消耗约 24.9 万 completion token,这一价格使得自托管 agentic coding 在企业规模下变得经济可行。
"西方需要可信赖的开源权重模型"
Poolside 联合 CEO Jason Warner 在发布声明中明确表态:"西方需要可以信赖、可以运行、可以基于其构建的开源权重模型。Laguna S 2.1 就是我们的回答。"联合创始人 Eiso Kant 则在 X 上进一步阐述:"我相信智能应该且必将成为商品",开源生态"不会因为在自己的类别中做到最好而获胜"。
这一表态的行业背景是:过去一年间,开源权重 AI 模型领域几乎由中国实验室主导——DeepSeek、Qwen、Kimi、GLM、MiniMax 和腾讯混元等占据了开发者下载和部署的主流。西方阵营自 OpenAI 于 2025 年 8 月发布 gpt-oss-120b 以来,已有近一年未在此赛道推出有竞争力的产品。Poolside 的核心商业模式正是向政府、国防和受监管企业提供内部部署方案,对这些客户而言,闭源 API 往往因合规与主权原因无法使用。
已知局限
Poolside 在发布博客中明确列出了模型的已知限制:对第三方 agent harness 存在过拟合(在工具 schema 稍有差异时可能出错)、嵌套工具调用中的 JSON 转义问题,以及在某些场景下的过度思考(overthinking)。目前 thinking 模式仅有开/关两种状态,尚无可配置的努力程度控制。thinking 模式对性能提升显著但同时大幅增加 token 消耗——Terminal-Bench 从 60.4% 提升至 70.2%,DeepSWE 从 16.5% 提升至 40.4%。
生态支持
模型以 OpenMDW-1.1 许可发布,权重已上线 Hugging Face,提供 BF16、FP8、INT4、NVFP4 等多种格式及官方 GGUF、MLX 转换版本。vLLM、SGLang、Ollama 和 llama.cpp 均提供 day-one 支持。还可通过 OpenRouter、Baseten、Vercel AI Gateway 等平台进行托管访问。
来源
- (官方发布博客)
- (完整基准运行轨迹)