AREX Feed Article
韩国主权 AI 亮剑:LG 放出 750B 开源模型,安全分碾压 DeepSeek
所有人都在关窗,LG 却把门打开了
全球 AI 竞赛的剧本一直由中美两家分饰。OpenAI 把最新模型锁在 API 付费墙后面,Anthropic 至今未开放模型权重,DeepSeek 和 Qwen 的「开源」也附着各自的使用限制。在这场越来越封闭的军备竞赛里,韩国的选择出人意料:把 750B 参数的第一个主权模型,以 Apache 2.0 完全开源。
三句话讲清 K-EXAONE 2.0:规模、许可证、安全
7 月 31 日,LG AI Research 在 Hugging Face 上发布了 K-EXAONE 2.0——韩国迄今为止规模最大的 AI 基础模型,总参数量 750B,活跃参数 37B,采用混合注意力 MoE(Mixture of Experts)架构。模型以 Apache 2.0 许可证发布,允许自由商用和修改。这是韩国科学技术信息通信部「主权 AI 基础模型项目」的第二代成果,也是该项目今年 1 月第一轮评估后,仅存的三个入围团队中第一个交出答卷的。
Lim Woo-hyung(임우형),LG AI Research 联席院长,在官方博客中写道:「K-EXAONE 2.0 远不只是造了一个更大的模型。我们的研究团队独立完成了从模型架构设计、数据准备、大规模分布式训练到推理基础设施的全部环节,证明了韩国已具备与全球前沿模型竞争的能力。」
安全分 99.8,长上下文碾压 GLM-5.1:K-EXAONE 2.0 的性能密码
K-EXAONE 2.0 在 24 个基准测试中平均得分 70.1,比一代的 63.3 提升了 10.8%。但如果只看平均数,会错过真正的故事——LG 把性能增益高度集中在了三个方向上:安全、长上下文理解和 Agentic 编码。
安全是 K-EXAONE 2.0 最突出的标签。在评估韩国及国际 AI 安全标准的 KGC-Safety 上,它拿到了 99.8 分;在地缘政治敏感场景的安全性测试 ROK-Fortress 上,得分 89.5。作为对比,DeepSeek V4 Pro Max 这两个数字分别是 82.8 和 47.6——后者不到 K-EXAONE 2.0 的一半。GLM-5.1 在同样的测试中得分为 71.3 和 73.2,全面落后。
长上下文理解是另一个 LG 重仓的方向。K-EXAONE 2.0 支持 262,144 个 token 的上下文窗口。在 OpenAI-MRCR(英文长上下文检索)上拿到 94.4 分,GLM-5.1 为 71.5;在 Ko-LongBench(韩文长上下文)上得 89.6,GLM-5.1 为 83.6。三项长上下文基准测试的平均分比 GLM-5.1 高出超过 10 个百分点。
Agentic 编码是第三块跳升的领域。SWE-Bench Verified 从一代的 49.4 跃升至 68.2,Terminal-Bench 2.1 从 30.3 升至 43.8——三项编码和 Agentic 编码基准测试的平均提升幅度接近 30%,是整体均分增幅的近三倍。在 Agentic 工具使用方面,τ3-Bench Banking 得分 14.2,超过 GLM-5.1 的 11.5 和 Qwen3.5 的 13.4。
但短板同样明显。在通用推理能力上,MMLU-Pro 83.5 低于 Qwen3.5 的 89.8 和 DeepSeek V4 Pro Max 的 87.5;Humanity's Last Exam 仅 18.3,对比 DeepSeek 的 37.7 差距显著。数学方面,AIME 2026 得分 92.3 尚可一战,但 HMMT 78.4 和 IMO Answer 78.6 均落后于 GLM-5.1 和 DeepSeek。
巴西 AI 评测博主 PanteraOS 在一篇长分析中指出:「平均 10% 的提升放在三倍参数量的背景下看起来不算多,但大规模扩展的收益从来不是均匀分布的——它集中在训练方决定优先投入的方向上。」换句话说,K-EXAONE 2.0 的性能地图,就是 LG 为「韩国主权 AI」刻下的战略优先级的镜像。
模型架构上,K-EXAONE 2.0 采用的是从一代 236B 模型「升格」(upcycling)的技术路线——同时扩展深度和宽度,并在两个 SwiGLU 分支后进行截断(clamping),以缓解深层网络中的激活值爆炸问题。78 层中,2 层为全密集注意力,76 层为稀疏 MoE,包含 256 个专家、每次激活 8 个。推理加速方面,支持 MTP(Multi-Token Prediction)和 DSpark 两种推测解码方案,生成速度可提升 3 到 5 倍。目前提供 SGLang 和 vLLM 两种部署方式,推荐使用 2 节点 × 8 张 H200 GPU。语言覆盖从 6 种扩展到 10 种,新增法语、意大利语、葡萄牙语和波兰语。
Lim Woo-hyung 挂帅:一支能独立走完 750B 全流程的团队
K-EXAONE 2.0 背后的核心人物是 LG AI Research 联席院长 Lim Woo-hyung。他在官方声明中强调:「当前模型不是终点,而是释放前沿级 AI 模型全部潜力的起点。我们将通过更高质量的数据、持续的后训练、强化学习和更先进的推理技术来推进 K-EXAONE。」
LG AI Research 是 LG 集团旗下的企业研究机构,2022 年成立,定位为 LG 整体 AI 战略的执行主体。团队独立完成了 750B 模型的架构设计、数据工程、分布式训练和推理基础设施建设——这在韩国是首次有机构完成如此规模模型的全流程自主开发。
在韩国科学技术信息通信部主导的「主权 AI 基础模型项目」中,LG AI Research 是少数通过 2026 年 1 月第一轮评估的团队之一。原定的 5 个精锐团队中,Naver Cloud 因未能满足「从零开发」标准而出局,NC AI 因评估分数不达标被淘汰。LG、SK Telecom 和 Upstage 三家进入第二轮。政府计划在上半年再补选一个团队,形成 4 队竞争格局。
除了 K-EXAONE 大型语言模型外,LG AI Research 还推出了 EXAONE 4.5 视觉语言模型,在 13 项多模态基准测试的平均分上超过 GPT-5 mini、Claude Sonnet 4.5 和 Qwen3-VL。EXAONE 4.5 已被韩国行政安全部选为 AI 安全举报系统的引擎,每日处理超过 39,000 条公共安全报告;同时被食品医药品安全厅采用,用于 AI 辅助药品审查系统。LG AI Research 透露,下周还将发布另一个面向特定行业的 AI 基础模型。
对垒 DeepSeek、Qwen、GLM:Apache 2.0 是 LG 最锋利的差异化武器
与 K-EXAONE 2.0 处于同一竞技场的全球开源模型不只有中美两国玩家。
Zhipu AI 的 GLM-5.1(754B 总参数,40B 活跃)是 K-EXAONE 2.0 在规模上最接近的竞争对手。在长上下文和安全两个维度,K-EXAONE 2.0 全面领先;但在 Humanity's Last Exam(31.0 vs 18.3)和 Terminal-Bench 2.1(61.8 vs 43.8)上,GLM-5.1 优势明显。
DeepSeek V4 Pro Max(1.6T 总参数,49B 活跃)在数学和编码领域是难以撼动的标杆——AIME 2026 95.2、SWE-Bench Verified 80.6、Terminal-Bench 61.8。但安全测试 ROK-Fortress 仅 47.6,不到 K-EXAONE 2.0 的一半,这与 DeepSeek 在中国监管环境下的训练策略有直接关系。
Qwen3.5(397B 总参数,仅 17B 活跃)是一面尴尬的镜子:以不到一半的总参数和不到一半的活跃参数,在 MMLU-Pro(89.8 vs 83.5)和 SWE-Bench Verified(76.4 vs 68.2)上大比分领先 K-EXAONE 2.0。韩国博主 Banandre 在分析文章中直言:「262K 上下文和顶级安全表现令人印象深刻,但为什么它会输给活跃参数只有 17B 的 Qwen3.5 在推理任务上?」
在韩国国内,K-EXAONE 面对的是 SK Telecom 的 A.X K1 和 Upstage 的 Solar Pro 3。三者同为「主权 AI 项目」入围团队,但路线各不相同:SKT 走的是电信运营商闭环生态,Upstage 以 102B 小模型主打高性价比 Agentic 能力,K-EXAONE 则选择了最大规模、最开放的路径。
但真正的差异化武器不是参数规模——是许可证。Apache 2.0 意味着任何企业可以拿 K-EXAONE 2.0 做商用部署、微调、再分发,无需付费、无需授权,这与 DeepSeek 和 Qwen 各自附加的使用条款不在同一个开放量级上。AI in Asia 在分析中指出,配合越南语等东盟语言的支持,「这使它成为东盟地区可落地的采购选项」。
这不是一场全面战争,韩国只押了三个方向
K-EXAONE 2.0 的发布揭开的不是一个技术奇迹,而是一个战略选择。
安全、长上下文、Agentic 编码——这三项是 LG 在 750B 参数里下注最重的方向,也是韩国「主权 AI」概念下最合理的优先项。一个服务于政府公文处理、金融合规、公共安全报告分析的主权模型,不需要 Humanity's Last Exam 拿高分,但必须在安全评估和长文本理解上做到无可挑剔。从这个角度看,K-EXAONE 2.0 不是输掉了推理比赛——它根本没报名那场比赛。
LG 下一张牌已经预告将在下周打出:另一个面向特定行业的基础模型。加上已在实际政务系统中运行的 EXAONE 4.5,K-EXAONE 生态正在从「造模型」过渡到「用模型」。这条路径的逻辑不是「造一个最好的通用模型」,而是「在选定的战场上做到最好,同时以完全开放的姿态让别人在别处补上短板」。
The Korea JoongAng Daily 和 The Korea Times 均在当日报道了这一发布。韩国国内社群反应分化:有人震惊于 750B 的规模(「我的 GPU 刚提交了提前退休申请」),有人质疑性能密度(「按基准看的话 Motif > Upstage = SKT > LG」),也有从业者认为 Apache 2.0 许可证才是真正的新闻。AI in Asia 将 K-EXAONE 2.0 形容为「东南亚市场上一个即刻可用的采购选项」。关注韩国半导体与 AI 赛道的 JCPR 分析称,后续关键看独立第三方评估和同等推理成本下的性价比对比。
韩国的主权 AI 路线图仍在半途。但 7 月 31 日这天,LG 用 750B 参数和一张 Apache 2.0 许可证说了一句话:这条赛道,韩国已经开跑了。
参考链接: