AREX Feed Article
万亿参数军备竞赛,Upstage 选了另一条路
2026 年 7 月 22 日下午,首尔江南区。Upstage 联合创始人兼 CEO Sung Kim(김성훈)站在 "Solar Open Weight Day" 的讲台上,身后的大屏幕打出了一张柱状图——K-Domain 韩国语综合基准 83.1 分,把 Claude Haiku 4.5、GPT-5.4 mini 和 DeepSeek-V4-Flash 全部压在下面。
这不是一场普通的模型发布会。这是韩国政府 "독파모"(独立 AI 基础模型)计划的第二阶段交卷时刻。而 Upstage 交出的答案,是一个只有 15B 激活参数、却敢跟 284B 的 DeepSeek-V4-Flash 正面掰手腕的 250B MoE 模型。
250B 的脑子,15B 的价格
Solar Open 2 的全称是 Solar Open 2 (250B-A15B),一个总参数 2500 亿、但每个 token 只激活 150 亿参数的混合专家模型。模型权重已通过 HuggingFace 以商业可用许可公开发布,同时附带完整的技术报告。
Sung Kim 在发布会上说得直白:"最近一些模型需要 NVIDIA B200 GPU 16 张才能跑,Solar Open 2 两张就够了。"量化版本由 NotaAI 同步发布,进一步压缩到两张 H200 GPU 即可部署。
这组数字的冲击力在于:当你看到 SWE-Bench Verified 70.4、LiveCodeBench 92.4、MMLU-Pro 86.2 这些分数时,会本能地以为面前是一头需要整个数据中心供养的巨兽。但实际上,它激活的计算量只有同级别模型的几分之一。
混合注意力如何把长上下文显存砍到四分之一
Solar Open 2 最值得讨论的技术选择,是它的 Hybrid Attention 架构。
模型总共 48 层,其中 75%——也就是 36 层——使用了线性注意力(Linear Attention),只有 12 层保留了传统的 Softmax 注意力。模式是 [Softmax, Linear×3] × 12。线性注意力层在固定大小的循环状态中管理序列信息,不需要让每一层的 KV-cache 随上下文长度线性膨胀。
这就带来两个直接后果。第一,长上下文的显存开销只有全 Softmax 架构的四分之一左右——因为 48 层中只有 12 层需要维护 KV-cache。第二,位置编码被完全移除了:Upstage 在这 12 个 Softmax 层中采用了 NoPE(无位置编码),从而绕过了 RoPE 的外推限制。换句话说,模型在处理远超训练长度的输入时,不会因为位置编码"超纲"而崩溃。
Upstage CTO Hwalsuk Lee(이활석)在发布会上透露了一组内部消融数据:与全 Softmax 的 Solar Open 100B 架构对比,Solar Open 2 的 Hybrid Attention 设计在仅消耗 210B 训练 token 时就达到了前者需要 671B token 才能获得的 MMLU 水平——训练效率提升约 3.2 倍。
另一个精巧的设计是 Selective Weight Transfer。当 Upstage 从 102B 的 Solar Open 1 跃迁到 250B 的新架构时,新旧模型的参数形状并不完全兼容。Upstage 没有直接随机初始化,而是挑选出仅有 2.3% 能在架构变化后存活的权重进行迁移,其余全部重新随机初始化。在一项 200B-A15B 代理实验中,使用 Selective Weight Transfer 的模型仅用 120 亿 token 就达到了随机初始化模型 220 亿 token 才能企及的损失值——节省了约 42% 的训练 token。
训练数据方面,Solar Open 2 在 12 万亿 token 上完成了预训练,消耗了约 200 万 GPU 小时(NVIDIA B200)。但真正让它区别于通用聊天模型的,是 Upstage 自建的 Agent 训练数据管线。
这条管线覆盖四个核心场景:搜索(区分"靠记忆回答"和"需要检索"的问题,经过多轮验证筛选)、工具调用(在真实环境中执行并回读结果来验证,而非仅判断工具选择是否正确)、编码(在终端中写代码、运行测试、根据失败结果循环修正),以及 Upstage 称之为 OfficeVerse 的办公场景——让模型在真实的 Excel、Word、PowerPoint、PDF 环境中完成文档交叉核对、公式重算、报告生成等任务,并由自动评分系统验证结果。
结果是,Solar Open 2 在多个 Agent 基准上表现突出:SWE-Bench Verified 70.4(从 Solar Open 1 的 15.4 跃升 55 个百分点),MCP-Atlas 58.2,APEX-Agents 16.6(在所有对比模型中最高),IFBench 80.0。尤其值得关注的是 SWE-Bench Verified——70.4 分已经逼近了更大的闭源模型区间。
在知识基准上,Solar Open 2 同样不容忽视:MMLU-Pro 86.2、GPQA-Diamond 86.3,均在同级别模型中排名第一;LiveCodeBench v6 92.4,超越 DeepSeek-V4-Flash 的 92.3 和 MiMo-V2.5 的 89.1;AIME2026 数学竞赛 95.7 分。
从 독파모 到 HuggingFace:一把政府押注的赌局
Solar Open 2 不仅是一个模型,更是韩国 "독파모"(Dokpamo,독자 파운데이션 모델 / 独立基础模型)计划的旗帜性成果。
这个由政府主导、企业执行的项目,目标直白:在 AI 基础模型层建立韩国自主能力,避免在关键基础设施上完全依赖海外供应商。Solar Open 1(102B)是第一阶段的验证品,Solar Open 2 则是第二阶段的正式答卷。
Upstage 的底气来源于积累。CEO Sung Kim 是香港科技大学计算机系前教授,2014 年联合创立 Upstage,在文档 AI 和企业级 NLP 领域深耕多年。CTO Hwalsuk Lee 则在深度学习模型优化和部署方面有深厚积累。公司以 "Building AGI for Work" 为使命,核心赌注是:未来的 AI 竞争不在聊天,而在谁能真正替企业干活。
这条路线在 Solar Open 2 中体现得淋漓尽致。它不追求在每一个通用基准上拿第一,而是集中火力打 Agent 能力——工具调用、多步推理、长任务执行。Sung Kim 的阐述一针见血:"生成式 AI 现在必须超越聊天,真正处理实际工作,才能有竞争力。"
跟 DeepSeek 对标只是表象,真正的战场在办公楼里
如果只看英文基准,Solar Open 2 和 DeepSeek-V4-Flash(284B-A13B)打得难解难分:MMLU-Pro 86.2 vs 85.9,GPQA-Diamond 86.3 vs 88.9,LiveCodeBench 92.4 vs 92.3,SWE-Bench Verified 70.4 vs 73.8。输赢在伯仲之间。
但 Solar Open 2 真正的差异化不在英文赛道上。
第一,韩国语性能是它的护城河。Solar Open 2 使用专门优化的 tokenizer,处理同一段韩国语文本所需的 token 数仅为全球主流模型的 50% 到 80%。在 Upstage 对比的 12 种 tokenizer 中,Solar Open 2 的韩国语办公文本 token 效率排名第一,比最优的全球模型高出约 24%。更少的 token 意味着更低的推理成本和更长的有效上下文。在 KMMLU-Pro(78.4)、CLIcK(90.7)、KorMedMCQA(93.0)等韩国语基准上,Solar Open 2 持续压制 Claude Haiku 4.5 和 GPT-5.4 mini。
第二,Ko-GDPval 是真正的杀手锏。这是一个模拟真实办公场景的 Agent 基准,覆盖 58 种职业的 170 个实际工作任务——律师、会计师、感染控制专家等角色的真实产出(报告、方案、简报)会被直接评分。Solar Open 2 拿到 86.8 分,仅比 DeepSeek-V4-Pro(86.9)低 0.16 分。而 DeepSeek-V4-Pro 是一个 1.6T 参数的巨物,活性参数约 45B,是 Solar Open 2 的三倍。
AI 研究员 Jun Song(@jun_song,拥有 2.5 万关注者)在 X 上评论道:"韩国 AI 公司 Upstage 刚刚发布了一个新的开源模型。250B 总参数、15B 活性 MoE 架构,性能对标 DeepSeek-V4-Flash。来自新区域的主权 AI 总是令人振奋的风景。考虑到其强大的韩国语能力,这应该是韩国用户在 DGX 级别设备上本地运行的绝佳选择。"这条推文获得 158 个赞和 17 条回复。
开源社区也迅速给出了反应。Harry Tandy(@HarryTandy,AI 研究员,2.3 万关注者)感叹:"一年前,这个规模的开源模型是难以想象的。现在它们像任何其他发布一样直接出现在 HuggingFace 上。"Fadi Hares(@fadihares95)则对 SWE-Bench Verified 70.4 表示震惊:"基本上匹敌了更大的闭源模型。不过 MCP-Atlas 相较 Solar 100B 的跃升才是最让我吃惊的。"
Agent 时代,大不再是唯一的答案
Solar Open 2 的发布时机耐人寻味。就在前一天,Poolside 发布了 Laguna S 2.1(118B 总参 / 8B 活性 MoE,同样定位于 Agent 编码),Eiso Kant 在那篇广为传播的发布声明中写道:"如果五年后,世界上所有经济价值、科学意义和个人意义都由三四个公司提供智能来支撑,我会称之为反乌托邦科幻小说。"
Upstage 用自己的方式回应了同一个命题。当全球 AI 竞赛在万亿参数的数量级上不断加码时,Solar Open 2 押注的是一条不同的路径:不是造最大的模型,而是造最能落地的模型。250B 的总参数储备知识容量,15B 的活性参数控制推理成本,混合注意力压缩长上下文开销,OfficeVerse 训练管线确保模型真的能干活——这一整套设计的核心逻辑不是"赢在基准",而是"赢在部署"。
接下来要看的是,韩国本土的企业和政府机构是否愿意为这个赌注买单。如果 Solar Open 2 真的能在律师事务所、会计师事务所、医院和银行的后台跑起来,"主权 AI"就不只是一个政治口号,而是一张可量化的资产负债表。
参考链接:
本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成任何投资或技术建议。_