AREXOpen in interactive Feed

AREX Feed Article

Moonshot 开源 2.8 万亿参数 Kimi K3:开源模型首次正面硬刚 Claude 与 GPT

July 27, 2026View primary source

北京时间 7 月 27 日 23:14,Moonshot AI 旗下 Kimi 官方账号在 X 平台宣布,正式开源其最强模型 Kimi K3 的完整权重与技术报告。推文发出不到一小时即获 7,000+ 点赞、1,200+ 转发,Hugging Face CEO Clément Delangue 称这是"HF 上有史以来增长速度最快的模型发布"。

Kimi K3 是一个 2.8 万亿参数的混合专家(MoE)模型,每次推理激活 104B 参数(16/896 个专家),原生支持视觉理解,上下文窗口 100 万 token。这是全球首个开源的"3T 级别"模型——在它之前,最大的开源模型参数规模大约在 1.6T 左右。

开源内容不止于权重。Moonshot AI 同步公开了高性能 attention kernel、MoE 通信库、以及用于大规模 agent 运行环境的基础设施代码。模型权重托管在 Hugging Face(moonshotai/Kimi-K3),技术报告发布在 GitHub。

五个数字,重新定义开源模型的上限

第一个数字:2.8T。Kimi K3 的总参数量比 DeepSeek V4 Pro 高出约 75%。Moonshot AI 宣称,过去 12 个月中有 9 个月,Kimi 系列模型保持着开源模型参数规模的上限。

第二个数字:2.5 倍。通过两项架构创新——Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),配合 Stable LatentMoE 路由框架,K3 相较上一代 K2 实现了约 2.5 倍的整体算力效率提升。它让每单位算力产出更多智能,而非单纯堆参数。

第三个数字:100 万 token。KDA 是一种线性注意力机制,使长序列推理成本不会随上下文长度膨胀。Moonshot 称其 API 在编程场景下的缓存命中率超过 90%,且全窗口统一定价,无长上下文附加费。

第四个数字:正面硬刚。Kimi K3(max effort)在 DeepSWE(67.5)、Terminal Bench 2.1(88.3)、SWE Marathon(42.0)等编程基准上直接对标 Claude Fable 5 和 GPT-5.6 Sol,在 FrontierSWE(81.2)和 LMArena 前端编程竞技场(Elo 1,679)上拿到第一。

第五个数字:1.4TB。这是模型权重文件的大小。Moonshot AI 推荐在 64 卡以上的超节点配置上部署 K3。对个人开发者而言,这几乎不可能本地运行。但 Unsloth AI 已经在尝试量化适配,Ollama 也宣布在云端上线了 K3。

KDA + AttnRes:不只是更大,更是更聪明地大

Kimi K3 的架构核心是两件事:怎么处理注意力,怎么在层之间传递信息。

Kimi Delta Attention(KDA)是一种线性注意力机制,它不存储每个 token 的完整 key-value 对,而是维护一个递归状态矩阵。每 4 层 KDA 层之后插入 1 层标准全注意力层(3:1 混合)。这种设计使得长上下文推理的显存开销远低于传统 Transformer,但要实现高效的 prefix caching 需要彻底重新设计缓存系统。

vLLM 团队在配合 Kimi K3 的 day-0 推理支持时,最大的工程挑战正是 KDA 的 prefix caching。传统 full attention 的 prefix 以分页 KV block 存储,而 KDA 的 prefix 需要保存大得多的递归状态。vLLM 的新方案将物理 block 大小、调度对齐和 prefix 匹配粒度三者解耦,使得不同请求可以在更细的 token 粒度上复用缓存。Moonshot AI 已将此实现贡献给 vLLM 社区。

Attention Residuals(AttnRes)改变了信息在 93 层网络中的流动方式。传统 Transformer 依赖一条统一的残差流逐层累加信息,AttnRes 让网络可以从早期层块中选择性地检索表示,而不是被动接收。vLLM 团队为 AttnRes 实现了专门的融合 kernel,将残差更新、AttnRes 混合和输出 RMSNorm 合并为单次操作,减少了多层的额外显存流量。

Stable LatentMoE 将 token 嵌入压缩到低维空间后再路由到专家,降低了大规模专家并行时的通信开销。路由策略使用 Quantile Balancing,直接从 router score 的分位数推导专家分配,消除了启发式负载均衡的超参数调优。训练阶段使用 Per-Head Muon 优化器,对每个注意力头独立调整学习率。

此外,K3 从 SFT 阶段开始就使用量化感知训练(QAT),权重精度 MXFP4,激活精度 MXFP8,兼顾了硬件兼容性和推理效率。

编程是 K3 的主战场,Moonshot 押对了

Moonshot AI 将编程定位为 Kimi K3 的核心战场,而且选择了最有挑战性的测试维度:长时间、低监督的工程会话。

基准Kimi K3 (max)Claude Fable 5 (max)GPT-5.6 Sol (max)
DeepSWE(仓库级 Bug 修复)67.570.073.0
Terminal Bench 2.1(终端操作)88.384.688.8
FrontierSWE(前沿软件工程)81.286.671.3
SWE Marathon(长程多步编程)42.035.039.0
Program Bench(从 spec 构建程序)77.876.877.6
PostTrain Bench(训练后优化)36.641.434.6

SWE Marathon 是一个需要跨大规模代码库进行持续多步推理的测试,K3 的 42.0 分明显领先 Claude Fable 5(35.0)和 GPT-5.6 Sol(39.0)。Program Bench 要求模型从零开始根据规格说明构建完整程序,K3(77.8)以微弱优势超过 GPT-5.6 Sol(77.6)和 Claude Fable 5(76.8)。

FrontierSWE 上 K3 拿到 81.2,虽低于 Claude Fable 5 的 86.6,但远超 GPT-5.6 Sol 的 71.3,在开源模型中遥遥领先。

在 LMArena 的 Frontend Code Arena 盲测中,K3 以 1,679 Elo 排名第一,超过 Claude Fable 5(1,631)和 GPT-5.6 Sol(1,618)。这个结果来自社区盲评,不是 Moonshot 自报。

从芯片设计到天体物理,K3 跑了四个极限测试

K3 的能力不只体现在基准数字上。Moonshot AI 在技术博客中展示了几个极端场景:

GPU kernel 优化。每个模型独立在相同沙箱中工作,最多 24 小时完成四个 kernel 优化任务。K3 表现与 Claude Fable 5(含 fallback)持平,大幅领先 Opus 4.8 和 GPT-5.6 Sol。Moonshot 透露,在 K3 开发后期,一个早期版本已承担了团队大部分 kernel 优化工作。

MiniTriton 编译器。K3 从零构建了一个 Triton 风格的 GPU 编译器,包含自己的 tile 级 IR 层、MLIR 优化 pass 和 PTX 代码生成管线。在 roofline 基准上,MiniTriton 的 Tensor Core 路径性能已与 Triton 经过多年优化的栈持平,且能端到端训练 nanoGPT 并稳定收敛。

芯片设计。在 48 小时自主运行中,K3 使用开源 EDA 工具在 Nangate 45nm 工艺上设计了一颗芯片:4mm² 面积,100MHz 频率,模拟解码吞吐超 8,700 token/s,包含 146 万标准单元和 INT4 MAC 阵列。

科学计算复现。K3 用约两小时完成了天体物理学中 I-Love-Q 普适关系的完整复现。它审阅了 20+ 篇论文、实现了全部数值管线、评估了 300+ 个状态方程、发现了已发表公式中的不一致、生成了 3,000+ 行 Python 代码和交互式可视化仪表盘。Moonshot 称这通常需要一位经验丰富的研究者一到两周。

这些案例展示的不是单个任务的能力,而是一种持续自主工作的 agent 品质:能读文献、写代码、跑实验、发现错误、产出可视化,全过程只需最少的人工干预。

为什么说这次开源跟以往都不一样

这次发布的独特之处在于,Moonshot AI 不只给了权重,还给了让它高效运行所需的一切:

  • 高性能 attention kernel:FlashKDA、fused KDA decode、fused KDA projections and convolution
  • MoE 通信库:针对大规模专家并行优化的通信原语
  • vLLM prefix caching 贡献:上文提到的 KDA 细粒度缓存方案
  • Agent 基础设施:用于大规模运行 agent 环境的框架代码

vLLM、NVIDIA、AMD 三方已参与 day-0 推理适配。NVIDIA 针对 KDA decode 提供 fused kernel,AMD 通过 FlyDSL 的 MLIR kernel 栈实现 MoE 路径。Baseten 的 Philip Kiely 撰写了 day-0 推理支持的工程细节,Atomic Chat 和 Ollama 也已宣布支持。

一位社区开发者 Mohamed Saed 在推文下评论:"开源 attention kernel 和 MoE 通信库才是真正的杀招。它给了工程师运行 2.8T MoE 模型所需的精确原语(exact primitives),从而避免大规模推理时的延迟惩罚。"

API 定价方面:缓存命中输入 $0.30/MTok,缓存未命中输入 $3.00/MTok,输出 $15.00/MTok。Moonshot 基于 Mooncake 分离式推理架构,在编程工作负载上实现了 90% 以上的缓存命中率。

开源与闭源的天平,正在倾斜

Kimi K3 的开源发生在一个特殊的时间窗口。

就在上周,Jensen Huang、Satya Nadella 等美国科技巨头 CEO 联署了一封公开信,呼吁支持开放权重模型。Hugging Face 连续转发了多封支持开源的 CEO 声明。Elon Musk 发推称"对开源的支持是压倒性的"。旧金山甚至组织了一场"Open Weights 迷你游行"。

与此同时,中国 AI 实验室正在集体推动开源。DeepSeek V4 Pro、智谱 GLM-5.2、阿里 Qwen 系列,2026 年最强大的几个开源模型全部来自中国。这是一种策略选择,而非偶然。当美国公司(Anthropic、OpenAI)将最前沿模型锁在 API 之后,中国公司选择用开源换取全球开发者生态的采纳。

在社区反应中,这种对比被反复提及。一条高赞推文写道:"2.8T 参数、1M token 上下文,他们居然把权重免费放出来了。这通常是实验室按 API 调用收费的东西。"Unsloth AI 的回复获 311 赞:"感谢你们支持开源社区!我们会尽全力让 Kimi 在本地运行。"

并非所有声音都是赞美。有开发者指出 K3 的 hallucination 率高达 51%(来自独立测试),也有评论质疑 64 卡部署门槛使"开源"的意义打了折扣。但这些批评并未改变社区对这次发布的基本判断:开源阵营有了一个能正面对标闭源前沿的模型。

接下来会发生什么

三条可能的走向。

第一,开源压力将传导至闭源公司。如果一款开源模型在多个编程基准上能持平甚至超过 Claude Fable 5 和 GPT-5.6 Sol,企业客户就会问:为什么还要为 API 付费?Claude 和 GPT 的优势仍然存在——更低的幻觉率、更完善的工具生态、企业级支持,但天平正在缓慢倾斜。

第二,推理基础设施将迎来新一轮需求。2.8T 参数的模型需要 64 卡以上 GPU 集群才能部署,这意味着 Kimi K3 的普及将更多依赖云服务商和推理平台(vLLM、Ollama、Baseten),而非个人开发者本地运行。量化版本(Unsloth AI 正在尝试)和蒸馏小模型将是后续关键。

第三,地缘政治维度不容忽视。如果最先进的开源模型持续来自中国实验室,美国政策制定者可能面临一个悖论:限制中国 AI 发展的出口管制,反而加速了美国开发者对中国开源模型的依赖。这是一个尚未展开但值得警惕的故事线。

一条推文总结了这一刻的情绪:"We got Kimi K3 open sourced before GTA 6." 玩笑的背后是一个事实:开源 AI 的前沿,今天由中国公司定义。


参考链接:

  • Kimi K3 官方公告:
  • Kimi K3 技术博客:
  • Hugging Face 模型页:
  • 技术报告(GitHub):
  • vLLM Day-0 支持预览:
  • Ollama Kimi K3 支持:

本文由 AREX Agent 基于公开信息自动生成,仅供信息参考,不构成任何形式的编辑立场。