AREX Feed Article
当全球盯着硅谷和深圳,SK 电信悄悄把 688B 开源模型塞进了 Hugging Face
过去两年,开源大模型的叙事被三股力量瓜分:中国的 DeepSeek 和 Kimi 靠 MoE 架构压参数到极致,美国的 Meta 和 Mistral 靠生态铺路,而其他国家的"主权 AI"往往停留在政策文件和概念验证阶段。模型有,但不一定能打。
7 月 29 日,韩国 SK 电信(SK Telecom)把这个叙事撕开了一道口子。它把 688B 参数的 A.X K2 模型直接扔上了 Hugging Face,Apache 2.0 协议,附带一份详尽的技术报告。不是概念验证,不是仅供研究的半成品,而是一个在数学基准上全面压制 DeepSeek-V4 Flash、在韩语理解上碾压所有对手的完整产品。
30 多个百分点的跨越,不靠堆参数
A.X K2 是 SK 电信上一代模型 A.X K1(519B)的换代产品,总参数量从 519B 跃升至 688B,但激活参数维持 33B 不变。关键变化不在规模,在效率。
在 14 项评测中,A.X K2 相对 A.X K1 平均提升 32.2 个百分点。长上下文理解和 agent 相关评测的提升幅度更是达到约 83.9 个百分点。这不是靠把模型做大做到的(激活参数没变),而是靠架构重构实现的。
数学是 A.X K2 最强的名片。AIME26 得分 97.1%,在所有对比模型中排名第一,超过 DeepSeek-V4 Flash(96.7%)、Kimi-K2.6(95.4%)和 GLM-5.1(95.4%)。在更难的 Apex 基准上,A.X K2 拿到 45.8%,断崖式领先。第二名 DeepSeek-V4 Flash 只有 28.1%。
韩语理解更是降维打击:KMMLU-Pro 80.5%,KoBALT 73.0%,CLIcK 91.6%,三项全部排名第一。作为对比,Kimi-K2.6 在 CLIcK 上只有 80.9%,DeepSeek-V4 Flash 在 KoBALT 上以 75.3% 微弱领先。
一个值得注意的加分项:A.X K2 在 2025 年国际数学奥林匹克(IMO)上拿到 35/42 分,达到金牌线,且前五题均为满分 7/7。
不堆参数堆什么?三个架构级创新
A.X K2 的技术报告长达数十页,核心可以归结为三样东西:Sparse Gated Attention、Gated Norm、Think-Fusion。三者共同回答一个问题:怎么让 688B 的模型在实际推理中不慢、不崩,还能在低精度下跑得动。
Sparse Gated Attention:注意力不再照单全收
长上下文推理的核心瓶颈是注意力计算:序列越长,每个 token 要"看"的前文就越多,计算量平方级增长。
A.X K2 的做法是 Sparse Gated Attention(SGA),名字里藏了两层机制:
稀疏注意力是外层。一个轻量级的"索引器"(indexer)对每个 query 快速扫描所有 key-value 候选,只保留得分最高的 top-2048 个 token 送入后续的 Multi-head Latent Attention(MLA)。换句话说,模型不再对全量 KV cache 算注意力,而是先筛一遍,只把预算花在最相关的 2048 个位置上。
门控注意力是内层。每个注意力头(attention head)的输出经过一个可学习的门(output gate)调制后再进入输出投影。这个门在整个预训练期间都在线,给 MLA 引入了非线性,同时压制了"注意力沉没"(attention sink):某些 token 不管内容如何都获得不成比例的高注意力权重。
两层机制互相增强:门控把注意力沉没压下去之后,索引器拿到的是更干净的候选信号,有限的 2048 个位置预算花得更值。结果是在长上下文推理中,A.X K2 相比 A.X K1 保持了更高的 token 吞吐、更低的 TPOT(time per output token)和更低的 TTFT(time to first token)。
Gated Norm:用一个小门驯服百亿级激活值
大规模训练最怕的麻烦之一叫"巨量激活"(massive activation):某些隐藏层神经元的值比平均水平大几个数量级,持续出现在各层中,导致训练不稳定、量化误差大。A.X K1 用双归一化方案(pre-norm + post-norm)来压制,代价是架构更复杂。
A.X K2 的方案更简洁:Gated Norm(GN)。在 RMSNorm 归一化之后、激活值进入残差流之前,插入一个输入依赖的可学习门。这个门直接阻止归一化后的输出去拟合那些异常大的标量,从源头剪掉了巨量激活的土壤。
效果是双重的:训练稳定到不需要 A.X K1 的双归一化方案;推理时,激活分布更平滑,更适配 FP8 和 NVFP4 这样的窄位宽格式。配合原生 FP8 训练(正向和反向传播全程 E4M3),A.X K2 发布的 checkpoint 本身就是 block-scaled FP8,省掉了单独的量化步骤,下载后可以直接跑。
Think-Fusion:一个模型,两种推理模式
A.X K2 用一个模型同时支持"思考"和"不思考"两种模式,而不是训练两个分支。
实现叫 Think-Fusion:构造一个成对的 SFT 数据集,每个 prompt 同时配有思考和非思考两类回答,统一训练轨道。模型通过控制 token(而非分类标签)来切换模式:需要复杂推理时开启 enable_thinking,需要低延迟响应时关掉。后续再做多阶段的 on-policy RL 进一步打磨。
结果是一个模型,两种用法:思考模式下输出 ... 包裹的推理步骤再接答案,非思考模式直接给结论。
不是一家公司在战斗
A.X K2 并非 SK 电信一家的独立研发,而是韩国政府"主权 AI 基础模型项目"(Sovereign AI Foundation Model Project)的产物。这个项目的目标很明确:打造一个对韩语和韩国文化有深度理解的前沿级模型,减少对海外模型的依赖。
但 SK 电信没有停在"交作业"层面。围绕 A.X K2,它同步放出了一整条产品线:
- A.X K2 VL Light-Preview(21B):视觉-语言模型,瞄准制造业场景中的图纸、手册、收据识别;
- A.X K2 ALM(22B):音频-语言模型,面向客服中心和会议场景的语音分析;
- A.X K2 Raon-Speech(21B):与韩国游戏公司 Krafton 联合开发的语音模型,用于游戏内的 NPC 语音交互。
SK 电信基座模型办公室负责人金泰允(Kim Tae-yoon)在新闻稿中表示,团队"并行推进了一系列能力,使模型能广泛用于日常生活、办公和制造现场"。
落地场景也已经在推进。制造业方面,SK 电信计划今年下半年在钢铁企业 KG Steel 的冷轧线和汽车零部件企业 KONEC 的铸造与加工产线部署基于 A.X K2 的 AI agent 试用版。国防方面,已与韩国国防部签署 MOU,在陆军、海军、空军和海军陆战队推广基于 A.X K1 的量化模型。生物制药方面,正在与 SK Biopharmaceuticals 合作,利用 AI 将难治性癌症靶向疗法的早期药物研究周期从一至两年缩短到五个月。
赛道已经挤满了,A.X K2 占哪个位置?
把 A.X K2 放到 2026 年上半年的开源模型版图里,它的位置很清楚:
数学第一梯队。AIME26 的 97.1% 和 Apex 的 45.8% 让它在这两个核心数学基准上领先所有对比模型,包括 DeepSeek-V4 Flash、Kimi-K2.6 和 Qwen 3.5。
韩语绝对统治。这在意料之内:15.4% 的训练数据是韩语,且有 1.37T token 的韩国语自建语料。但对于韩国本土产业和政府场景来说,这是非用不可的理由。
Agent 能力中等偏上。τ²-Bench(电信场景)98.0% 排名第一,但 BrowseComp(≤10 次搜索)仅 9.3%,大幅落后于 GLM-5.1 的 29.1% 和 Qwen 3.5 的 26.9%。技术报告也坦承"agent 性能中等,反映了训练后阶段有限的 agent RL"。
推理效率靠架构而非靠硬件。原生 FP8 训练、SGA 稀疏注意力、Gated Norm 平滑激活,三管齐下让 A.X K2 在推理效率上不依赖最新硬件。四个 B300(275GB 每卡)就可以部署,vLLM 分支也在同步推进上游合并。
在社交媒体上,社区的反应集中在一个点上:688B 的盘子,33B 的胃口。@ShinkaIoT 评论说:"688B total but only 33B active means this sparse MoE is finally practical to run, routing efficiency doing the heavy lifting." 一位叫 @MerlynShelley6 的从业者给出了更长线的判断:"Models are increasingly becoming the foundation, not the moat." 而 @AndroidBlogger 的评论指向了地缘政治维度:"Korean government pushes to have their own big models. Smart move... EU should do the same."
主权 AI 的下一块拼图
A.X K2 本身是一张答卷,但它更大的意义在于验证了一条路径:在万亿参数级模型竞赛之外,MoE + 架构创新可以打出差异化。688B 总参、33B 激活、256 个路由专家。这些数字放在一起,说明 SK 电信选择的不是"更大更强"的路线,而是"更聪明地激活"。
SK 电信在新闻稿中已经明确表示,下一代模型将向万亿参数级推进。如果 A.X K2 证明的是"效率换竞争力",那 A.X K3 要回答的问题可能是"效率够不够换规模"。
眼下,这个 688B 的模型已经躺在 Hugging Face 上,FP8 checkpoint 直接可跑,Apache 2.0 协议放行商用。韩国政府押注的主权 AI 路线,至少到今天这一步,没有掉队。
参考链接
- _