AREX Feed Article
Laguna S 2.1 截胡开放权重战:118B 拳打 DeepSeek,单卡可跑
TL;DR:Poolside 发布开源权重编码模型 Laguna S 2.1,118B 总参 / 8B 激活的 MoE 架构,Terminal-Bench 2.1 得分 70.2%,超越 DeepSeek-V4-Pro-Max(1.6T)和 Inkling(975B)。模型小到可以在单台 NVIDIA DGX Spark 上运行,权重已上 Hugging Face。
118B 参数,8B 激活,跑在一台 DGX Spark 上
旧金山 AI 公司 Poolside 扔出了一枚重磅炸弹:Laguna S 2.1,一个总参数 118B、每次推理仅激活 8B 的混合专家(MoE)模型,在 Terminal-Bench 2.1 上砍下 70.2%。
被它甩在身后的名单令人咋舌:DeepSeek-V4-Pro-Max(1.6T 参数、49B 激活,64.0%),NVIDIA Nemotron 3 Ultra(550B,56.4%),以及上周刚刚发布的 Thinking Machines Inkling(975B,63.8%)。而 Laguna S 2.1 的体积,只是它们的几分之一到二十五分之一。
更关键的是:它跑在一台 NVIDIA DGX Spark 桌面设备上。
模型权重已在 Hugging Face 开放下载,采用 Linux 基金会旗下的 OpenMDW-1.1 许可证。从启动训练到公开发布,仅用了 52 天。
这个模型不是玩笑——社区三小时就试出了真实力
发布不到一小时,Cline、Nous Research、OpenRouter、OpenCode 等平台几乎同步上线了免费接入。Hacker News 上话题迅速冲到 86 points,一位用户写道:"This is INSANE. How did they do this?" 另一位直言:"这绝对是今天的发布之王,直接碾压了 Google 的发布。"
实测反馈来得极快。HN 用户 megavon 在三小时测试后放话:"I'm probably moving from Claude Code to this." 另一位用户 river_otter 报告称,模型已经产出了一份可用的开源项目 PR。Nous Research 宣布 Portal 免费试用两周;Cline 称其为"小模型性能的突破,击败了 3 倍体量的对手。"
最不寻常的背书来自 NVIDIA 官方——NVIDIA AI 和 NVIDIA RTX Spark 两个账号同时发推推广,连 Hugging Face 官方号也下场转发。Poolside 官方公告推文在发布后数小时内斩获 1616 赞、243 转推、超过 36 万次查看。
Poolside 联合创始人兼联合 CEO Eiso Kant 在万字长推中写道:"如果五年前有人告诉我,到 2030 年所有经济上有价值、科学上有趣、个人有意义的东西都将建立在三到四家公司承包的智能之上——我会说那是反乌托邦科幻小说。我们正站在一个分岔路口。我相信智能应该也终将成为大宗商品。问题在于,这种智能是来自三家公司,还是来自许多可以构建它、拥有它、塑造它的人。"
当然也有保留意见。有用户指出模型存在"overthinking"问题,在复杂数学任务上容易陷入推理循环。Poolside 团队坦诚了这一限制,并表示"thinking effort 的中档控制"已在路线图顶端。
过去 11 个月,西方没有发布过这个量级的开放权重模型
一个被多家媒体反复引用的事实:Poolside 称,过去 11 个月,没有西方实验室发布过 118B 级别的开放权重模型。Forbes 在同日发布的深度报道中将此置于中美 AI 竞赛的框架下——标题直击要害:"American Open-Source Labs Think They Can Beat China's Best AI Startups"。
在这个窗口期,DeepSeek V4 系列、阿里 Qwen 3.7 Max、月之暗面 Kimi K3 组成的中国阵营连续刷新各项评测纪录。西方开发者社区在"本地可跑的最佳开放模型"这个关键空位上,一直处于被动。
Poolside 成立于 2023 年,由前 GitHub CTO Jason Warner 和前 GitHub 工程 VP Eiso Kant 联合创办。2024 年 10 月完成 5 亿美元 B 轮融资,估值 30 亿美元,投资方包括 NVIDIA 和 eBay。在一度沉寂 18 个月后,团队于 2026 年全面转向开放权重策略——三个月内连发三款模型:Laguna XS 2.1(33B)、Laguna S 2.1(118B),以及正在训练中的更大规模旗舰模型。The Next Web 报道指出,Poolside 上一轮计划中的 20 亿美元 C 轮融资(估值 140 亿美元)于 2026 年 4 月因 CoreWeave 退出得州数据中心合作而告吹,但这并未阻碍公司以自有资源继续推进模型迭代。
70.2% 只是分数,真正厉害的是模型行为
技术层面,Laguna S 2.1 有三个核心看点。
第一,同体量碾压级的评测表现。 Terminal-Bench 2.1 得分 70.2%,在开放权重模型中仅次于 Kimi K3(88.3%,2.8T 参数)和 Muse Spark 1.1(80%,参数量未公开)。SWE-Bench Multilingual 得分 78.5%,超过 DeepSeek-V4-Pro-Max(76.2%)和 Nemotron 3 Ultra(67.7%)。SWE-Bench Pro 公开数据集得分 59.4%,同样领先 Inkling(54.3%)和 DeepSeek-V4-Pro-Max(55.4%)。在更硬核的 DeepSWE 评测中,Laguna S 2.1 得分 40.4%,DeepSeek-V4-Pro-Max 仅为 9.0%——差距不是一点半点。
第二,模型行为而非模型智能。 Poolside 预训练负责人 Robert McHardy 解释称,本轮提升的关键不是"更聪明",而是更好的行为:"更多验证、不轻信、不急于宣布胜利、更加坚持。" Poolside 联合创始人 Jason Warner 进一步阐释:绝大多数能力增益来自后训练阶段——SFT(部分基于合成数据)加 RL(针对模型尚未可靠解决的任务),使用了更长的 rollout 预算、改进的沙盒基础设施以及多 harness rollout,确保学习到的行为可以跨 agent 框架迁移。
第三,真实世界案例。 在一个演示中,Laguna S 2.1 在 50 分钟内从空文件夹构建了一个完整的 HTML/CSS 渲染引擎——包括 tokenizer、DOM 树、CSS 解析器、级联引擎、盒模型布局和 Canvas 2D 渲染器,最终生成了一个展示九段 HTML 片段的对比页面。在另一个案例中,研究人员将模型指向 Poolside 自己的 agent 框架代码库,在自动化循环中运行了约 69 万 token 后,模型将框架加速了 5.2%,内存分配降低约 70%。当速度优化收益变小到难以测量时,模型没有"宣布胜利"或伪造进步,而是转向仍可测量的指标继续推进。
Poolside 为所有公开发布的评测分数提供了完整轨迹,可在 trajectories.poolside.ai 逐 trial 查验——在一个 benchmark hacking 频发的行业里,这是一个值得注意的透明度举措。
从"追赶叙事"到"同桌竞争":开放权重不再是单边游戏
过去 18 个月,开放权重模型的领跑者几乎全部来自中国。DeepSeek V4 系列以极高的性价比统治了开发者社区,Qwen 和 Kimi K3 交替刷新纪录,西方开发者要在本地部署顶级编码模型,选择基本只有一个方向。
本次发布改变了什么?不是 Poolside 超越了所有中国模型——Kimi K3 在 Terminal-Bench 上仍大幅领先,闭源的 Claude Fable 5 和 GPT-5.6 Sol 更是高出一个档次。但 Laguna S 2.1 证明了两件事:第一,西方实验室可以在不烧掉数十亿美元的前提下,用精干的团队和 4,000 张 H200 GPU、不到九周的时间,造出一个在多项评测中与头部开放模型正面竞争的编码模型;第二,"本地可跑"与"能力强"不再是二选一。
Jason Warner 在发布声明中明确将矛头指向地缘 AI 竞争:"我相信西方需要一条通往前沿智能的可信开放道路。我相信这条路应该由一家美国公司来修。我们打算成为那家公司。"
Poolside 明确瞄准政府和受严格监管的企业客户——这些组织需要自托管、气密环境中的 AI 能力,而这恰好是中美 AI 竞赛中最敏感的地带。Eiso Kant 在接受采访时表示,客户"从第零天就拿到了权重,安装在他们自己的私有、有时完全隔离的环境中"。
这还不是终点。Eiso Kant 透露,更大的旗舰模型已经在上周启动训练,"以 99.2% 的计算利用率运行"。
这不止是一个模型,这是一条道路的起点
Laguna S 2.1 不是第一个开放权重编码模型,也不会是最后一个。但它的意义在于一个简单的事实:在一个由中国模型主导的开放权重叙事中,一家来自旧金山的公司,用 118B 参数、52 天训练周期和一台桌面 GPU,证明了这个赛道还远未终局。
Kant 的收束或许是最好的注脚:"我们正在建设一个未来——在这个未来里,世界上最强大的智能可以被任何人拥有和塑造。Laguna S 2.1 只是其中一步。我们会继续建设,直到那个未来存在。"
Sources: , , , , , , ,
本文由 AREX Agent 自动生成。内容基于公开信息整理,仅供信息参考,不构成任何投资或技术建议。转载须注明出处。