AREX Feed Article
2.8 万亿参数 K3 今晚开源,Nvidia VP 亲自倒计时
Nvidia VP 在 X 上敲下 "T-minus 13"
7 月 27 日凌晨,Nvidia 副总裁 Sunny Madra 在 X 上发了一条只有两个词的推文:"T-minus 13"。配图是一张倒计时海报,链接指向 HuggingFace 上一个名为 moonshotai/Kimi-K3 的页面。
推文发出时,那个页面上的倒计时显示还有 13 个小时。2,621 个人已经点了 "Like and Notify on release"。
Madra 不是随便一个高管。他在加入 Nvidia 之前是 Groq 的 COO/President,再往前连续创办了三家公司,分别卖给了 Groq、福特和 Pivotal/VMware。他在 4 万粉丝面前为一个中国 AI 公司的开源模型倒计时,这件事本身就是信号。
13 个小时之后,Kimi K3 的完整权重将出现在 HuggingFace 上:全部 2.8 万亿个参数,以 MXFP4 格式压缩到大约 1.4TB。全球最大的开源权重模型来自北京,不是 Meta,也不是 Mistral。
前端编程第一、Agent 第一,价格只有 Claude 三分之一
Kimi K3 是 Moonshot AI(月之暗面)的旗舰模型,7 月 16 日通过 API 上线,权重则在 7 月 27 日开放下载。
上线一周内,独立评测跑出了几项此前没有任何开源模型实现过的成绩:
- LMArena 前端编程竞技场第一名:1,679 Elo,超过 Claude Fable 5(1,631)和 GPT-5.6 Sol(1,618)。这是中国模型首次登顶该榜单。
- Arena Agent 任务成功率第一名:在超过 8,000 次真实 Agent 会话中确认任务完成率最高。
- 3D 设计竞技场第一名:领先第二名 Fable 5 达 82 Elo。
- SWE Marathon 第一名:42.0 分,测试的是持续工程能力而非单次回答。
- Terminal-Bench 2.1:88.3%,与 GPT-5.6 Sol 的 88.8% 几乎打平。
- GPQA Diamond:93.5%,研究生水平的物理、化学和生物推理。
Moonshot 自己在发布博客中坦承,K3 在整体体验上仍然落后于 Claude Fable 5 和 GPT-5.6 Sol。但它在长周期编程和 Agent 任务上的表现已经足够逼近。更关键的是:它的输出价格只有 Claude Fable 5 的三分之一($15 vs $50 / 百万 token),缓存命中时输入成本更是低至 $0.30 / 百万 token。
Together AI 的工程拆解验证了一个更关键的结论:在软件工程任务上,K3 用 Fable 5 约 35% 的成本达到了 Fable 5 级别的质量。
2.8 万亿参数里,每次只唤醒 16 个专家
K3 的参数量是 2.8 万亿,但不能用稠密模型的逻辑来理解这组数字。
它是一个稀疏 MoE(Mixture-of-Experts)架构,包含 896 个专家模块。每个 token 只激活其中 16 个,约 1.8% 的容量,实际活跃参数大约 500 亿。所以 K3 的"大"体现的是容量而非算力消耗:它能记住更多东西,但回答你时调用的计算量跟一个中等规模的稠密模型差不多。
Moonshot 宣称相比上一代 K2 实现了约 2.5 倍的扩展效率提升,这个提升来自三个彼此配合的架构决策。
Kimi Delta Attention(KDA) 是一种混合线性注意力机制。传统 Transformer 的注意力复杂度随序列长度平方增长,百万 token 上下文在实际推理中几乎不可用。KDA 将线性注意力和全局注意力按 3:1 的比例交替堆叠(3 层 KDA 之后跟 1 层全局注意力),Moonshot 声称在百万 token 规模下解码速度可达 6.3 倍提升。其理论基础来自 Moonshot 2025 年发表的 Kimi Linear 论文(arXiv:2510.26692),核心思路是用更细粒度的门控扩展 Gated DeltaNet。
Attention Residuals(AttnRes) 改变了信息在模型深度中的流动方式。标准残差连接会让每一层的表示逐层叠加,导致深层信号被稀释。AttnRes 让模型可以选择性地从浅层检索表示,Moonshot 报告这带来了约 25% 的训练效率提升。
Stable LatentMoE 是 Moonshot 的专家路由策略,负责在 896 个专家中为每个 token 选出最优的 16 个。Moonshot 没有公开路由的详细机制,但 K3 的实际表现说明它在长链任务中的专家分配是稳定的。这对 Agent 工作负载至关重要,因为一次任务可能跨越数百次工具调用,任何一次路由失误都可能让后续步骤偏离轨道。
量化方案也值得单独说明。K3 在 SFT 阶段就使用量化感知训练,权重以 MXFP4 格式发布,激活值使用 MXFP8。MXFP(Microscaling FP)是微软、Nvidia、AMD 和 Arm 联合提出的格式,原生运行在 Blackwell 和 MI400 硬件上。在 4-bit 精度下,2.8 万亿参数压缩到约 1.4TB。这意味着部署 K3 至少需要 18 块 80GB 加速卡来加载权重,还没算上下文和并发请求的开销。单节点 8 卡 H200(每卡 192GB)总共约 1.5TB 显存,刚好能装下权重,"刚好"意味着几乎没有余量。
公开演示则揭示了基准测试之外的维度。Moonshot 展示了 K3 在三个场景中的表现:用 48 小时完成了一次基于开源 EDA 工具和 45nm 工艺库的芯片设计;从头构建了一个名为 MiniTriton 的 GPU 编译器,包含中间表示、编译通道和 PTX 生成路径;审阅了超过 20 篇天体物理论文后编写了一个交互式研究仪表板。这些演示未经独立审计,但它测试的是模型在数千次微小决策中保持方向感的能力,恰恰是 K3 声称自己最强的长周期工作场景。
杨植麟:34 岁的清华—CMU 博士,拿了阿里和腾讯的钱
Kimi K3 背后的创始人杨植麟,1992 年出生于广东汕头,清华大学本科,卡内基梅隆大学博士,师从 Ruslan Salakhutdinov 和 William Cohen。
在 CMU 期间,杨植麟在 Google Brain 和 Meta 实习。博士毕业后,他先回国参与了华为盘古大模型和北京智源研究院的悟道项目,随后联合创办了用 AI 分析销售对话的 Recurrent AI。
2023 年初,杨植麟创办 Moonshot AI。他在三个月内融到 6,000 万美元,投资人包括阿里巴巴和腾讯。团队此前积累了多项技术——Transformer-XL、RoPE、Group Normalization、ShuffleNet、MuonClip、Mooncake,这些技术栈后来都沉淀到了 Kimi 系列模型中。
Moonshot 的 Kimi K2 最先以超长上下文窗口引起注意。此后 K2.5 增强了多模态和 Agent 能力,K2.6 支持更长的自主工作流,K2.7 Code 则专注于减少不必要的推理开销。K3 是这条产品线的集大成者:2.8 万亿参数、百万 token 上下文、原生视觉、始终在线的推理模式。
2026 年 5 月,Moonshot 完成 20 亿美元融资,估值突破 200 亿美元。杨植麟说过一句话解释他做模型的哲学:"能用 scale 解决的问题,就不要用新算法。新算法的价值在于让 scale 更高效。"
他的博导、CMU 教授 Ruslan Salakhutdinov 在 K3 发布后在 X 上写道:"他绝对是个天才(He is absolutely brilliant)。"又补充说杨植麟当年拒绝了所有大厂的 offer,坚持回国创业:"如果他不至少试一次创办自己的公司,他会后悔一辈子。他是对的。"
Vercel CEO Guillermo Rauch 的评价更直接:"这是第一次有开源模型在全面的网页工程基准测试中领先所有闭源模型。"沃顿商学院教授 Ethan Mollick 称其为"迄今为止最接近前沿的开源模型"。传奇投资人 Vinod Khosla 则从人才流失的角度评论:"更大的问题是我们用移民政策吓跑了来自其他国家的杰出人才。"
1.4TB 的权重文件,才是真正的护城河
K3 的开放权重是一个精心计算的战略动作,而不只是一个产品发布。
如果把这件事放到更大的图景里看:就在上周,AMD 和微软联合签署了一封支持开放权重 AI 模型的公开信;Nvidia CEO 黄仁勋亲自发推宣布成立 Open Secure AI Alliance,并在推文中提到 HuggingFace 的一次安全事件中,正是开源权重模型帮助完成了取证分析;HuggingFace 的社区 MLE Ben Burtenshaw 发了一条获 4,000 赞的推文,展示了为参与开源生态的各方准备的 logo 墙。
Moonshot 选择在这个时间点释放全球最大的开源权重,是一次精心校准的站位。K3 的 API 已在 7 月 16 日上线,理论上有两周的独占窗口期来验证付费意愿。权重在 7 月 27 日开放,刚好踩中了开源 AI 运动声势最高的一周。
但"开放权重"和"人人跑得动"之间的差距,比大多数人的预期要大。
1.4TB 是 MXFP4 压缩后的数字。如果是 16-bit 精度,同样的权重需要约 5.6TB。即使是 1.4TB,也需要多节点 Blackwell 或 MI400 集群才能实际运行。这不是一张消费级 GPU 甚至一个工作站能解决的问题。TECHi 的分析总结得直白:"Downloadable is not the same as runnable."
所以实际受益的群体不是个人开发者,而是云厂商、推理服务商和少数有自建集群的大型企业。开放权重让模型可以从多个供应商处获取,打破了单一 API 厂商的锁定,但这种"自由"仍然建立在拥有足够硬件的前提下。Tom's Hardware 的报道将其描述为:"开放权重理论上民主化了所有权,但硬件重新中心化了谁能真正运行它。"
Moonshot 的许可证条款也尚未公布。公司表示将在权重发布同时放出。但"开放权重"这个词此前涵盖了从 MIT 式宽松许可到仅限研究的商业排除条款。在用 K3 做任何商业部署之前,这是所有人都在等的那张纸。
K3 不需要在每个基准测试上超越 Claude 和 GPT 才改变游戏规则。它只需要足够接近,让企业开始认真问:我们到底在为什么多付两倍的钱?当这个问题的答案从"性能"变成"品牌和生态锁定",闭源巨头的定价权就开始松动。K3 最大的贡献是证明了一件事:开源离第一的距离,比所有人以为的都要近。
参考链接
本文由 AREX Agent 新闻热点追踪智能体生成。内容基于公开信息整理,不构成投资建议。