AREX Feed Article
2.8 万亿参数、开源权重、自进化内核:Kimi K3 把中国开源模型带进了 Frontier 牌桌
当一家中国 AI 公司同时干了两件事——在编程和知识工作基准上与 Claude Fable 5、GPT-5.6 Sol 正面交锋,并宣布两周后开源全部权重——"中国模型落后美国 8-12 个月"的旧叙事就不再成立了。
2026 年 7 月 16 日,月之暗面(Moonshot AI)正式发布 Kimi K3。这是一款 2.8 万亿参数的原生多模态 MoE 模型,拥有 100 万 token 上下文窗口,搭载两项自研架构创新——Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)。模型即日起在 kimi.com、Kimi Work、Kimi Code 和 Kimi API 上线,完整权重将于 7 月 27 日开放下载。
官方推文发布后 1 小时内即获得超过 6200 次点赞、818 次转发和 524 条引用。转发者中包括游戏引擎 libGDX 作者 Mario Zechner(@badlogicgames,5.5 万粉丝),以及拥有 21.8 万粉丝的科技大 V @IterIntellectus,后者简洁地写道:"THANK YOU CHINA"。TechCrunch、Financial Times、PYMNTS 和 CryptoBriefing 在发布前即已跟踪报道,FT 援引匿名消息源称 K3 的参数量将在 2 万亿到 3 万亿之间——实际数字最终落在 2.8 万亿。
"不只是美国实验室才能做 frontier intelligence 了"
一位法国开发者在引用推文中感叹:"Le frontier open-source vient de franchir un cap"(开源前沿刚刚跨过了一道门槛)。这句评论准确捕捉了 K3 发布的核心信息:这是第一次,来自中国的开源权重模型在编程(DeepSWE、Terminal-Bench、ProgramBench、SWE Marathon)、知识工作(GDPval-AA、BrowseComp)和 agent 能力等多个维度上,与 Anthropic 和 OpenAI 最昂贵的闭源旗舰全面对标,且不落下风。
K3 在所有六个编程基准上均进入前三。在 ProgramBench 和 SWE Marathon 上排名第一。在 Moonshot 为真实用户 agent 工作流量身定制的三个内部基准(Online Exp Bench、DECK-Bench、Finance-Bench)上,K3 Max 全面超越了 Claude Opus 4.8 Max 和 GPT-5.5 xhigh。在 BrowseComp 上,K3 以单 agent、无上下文压缩的配置拿下了 91.2%。
但数字之外,更值得关注的是 K3 如何做到这一点——以及它的自进化实验对行业意味着什么。
技术拆解:Delta Attention 怎么让百万 token 解码快了 6.3 倍
K3 的技术架构基于三个关键模块:Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)和 Stable LatentMoE。
KDA 解决的是长上下文推理的致命瓶颈。 标准 attention 的计算复杂度随序列长度平方增长。当上下文达到百万 token 级别时,解码延迟会变得无法忍受——这正是长程 agent 工作流(比如横跨整个代码仓库的持续重构任务)在实际生产中难以落地的根本原因。KDA 是一种混合线性注意力机制,它在标准 attention 的基础上引入 delta 更新路径,让模型在长序列解码时可以复用中间状态而非重复计算全量 KV cache。根据 Moonshot 公布的数据,KDA 在百万 token 上下文中的解码速度可达标准 attention 的 6.3 倍。
第二个创新 Attention Residuals 瞄准的是训练效率。深层 Transformer 中,信息在穿越数十层 attention 后会逐渐衰减,导致训练后期每单位算力新增的模型能力越来越少。AttnRes 在 attention 层之间增加残差连接,直接改善梯度流动和信息保留。Moonshot 声称,这一改动以不到 2% 的额外计算成本,换来了约 25% 的训练效率提升。换句话说,同样的 GPU 集群和预算,加入 AttnRes 后训练出的模型在各项指标上都会更强。
在专家混合架构上,K3 将稀疏度推向了一个新高度:总共 896 个专家,每个 token 仅激活其中 16 个,配合 Stable LatentMoE 框架保证在大规模训练中专家路由不会退化或崩塌。相比之下,K2 系列的稀疏度远低于此。Moonshot 表示,这些结构性改进加上改进的训练数据和配方,使 K3 的整体 scaling efficiency 相比 K2 提升了约 2.5 倍——即同等算力可以"炼"出更强的智能。
实验一:自进化内核优化——模型自己给自己写 attention kernel
这是 K3 发布中最令人震撼的实验。Moonshot 给 K3 布置了一个高度专业化的任务:优化其自身 AttnRes 模块的生产级 Triton kernel。这不是玩具级演示——目标 kernel 的参数是 96 层、8192 维 hidden size、8192 token 序列长度的真实训练配置。任务约束是"不改变数值精度,只优化速度"。
15 小时的不间断迭代后,K3 独立设计了一个新颖的两阶段 kernel 算法,融合了多个计算步骤,同时维持了严格的数值等价性。前向+反向传播的总耗时从 283.6 毫秒压缩到 114.4 毫秒——提速约 2.5 倍。在同一任务上,Claude Fable 5(含 fallback 机制)也达到了相近的最终性能,但 K3 的每轮迭代提升速度更快,意味着它更高效地探索了优化空间。
io.net 联合创始人 Tory Green(@MTorygreen,7.7 万粉丝)对此评论一针见血:"K3 重写了自己的 attention kernel,结果跑到了 Fable 和 GPT-5.6 前面。Frontier labs 一直说这种自改进能力需要安全审查和受控 API——而 K3 的权重 7 月 27 日就会出现在 Hugging Face 上。等他们决定怎么管控自改进的时候,权重已经在百万块硬盘上了。"
实验二:编程基准——全面压制 Opus 4.8,逼近 Fable 5
在编程能力方面,K3 展现了从"接近闭源旗舰"到"全面对标"的质变。以下是 Moonshot 公布的基准测试结果(所有测试均在 max 或 xhigh thinking effort 下运行):
| 基准 | Kimi K3 | Claude Opus 4.8 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|
| DeepSWE | 67.5 | — | — | — |
| FrontierSWE | 81.2 | — | — | — |
| Terminal-Bench 2.1 | 88.3 | — | — | — |
| ProgramBench | 77.8(#1) | — | — | — |
| SWE Marathon | 42.0(#1) | — | — | — |
| Kimi Code Bench 2.0 | 72.9 | — | — | — |
BenchLM 在评估中指出,这张来自非官方渠道的截图缺少原始 URL、测试环境和可复现设置,因此列为"临时展示"行,K3 尚未进入正式排名。但从趋势来看,K3 的编程能力已显著超越 Opus 4.8,与 Fable 5 和 GPT-5.6 Sol 处于同一梯队。
开发者 @darvasch 的总结在社区中被广泛引用:"K3 可能是新的编程性价比之王——六个基准全部前三,API 价格约为 Fable 的三分之一。"
实验三:知识工作与 agent 能力——在真实工作流上超越 Opus 4.8
Moonshot 为 K3 设计了一套内部 agent 工作流基准,取材自真实用户的日常使用模式:
- Online Exp Bench:75.5(K3 Max),超越 Opus 4.8 Max 和 GPT-5.5 xhigh
- DECK-Bench:73.5(K3 Max),同样全面领先
- Finance-Bench:62.6(K3 Max)
在第三方评估中,K3 在 GDPval-AA v2 上获得 1687 Elo,AA-Briefcase 上 1527 Elo——这两个基准专门评估 AI 在专业工作场景中的 agent 能力。在 BrowseComp(复杂信息检索)上,K3 以单 agent、无上下文压缩的基础配置即拿下了 91.2%。
这三个内部基准的设计意图很明确:不只看模型在标准学术测试上的表现,更要看在真实产品环境中,用户反复遇到的 agent 挑战——比如多步信息检索、跨文档推理和金融数据分析——模型能否可靠地完成任务。
实验四:视觉驱动的交互式体验——"vision in the loop"
K3 支持原生视频理解,并且可以在代码生成和实时截图之间形成闭环——Moonshot 称之为"vision in the loop"。在演示中,K3 可以根据一张静态图片或一段视频,自主生成完全可玩的交互式网页体验:模型同时调用 3D 推理、编程和视觉能力,在写出第一版代码后截取运行画面,根据视觉反馈判断哪里有 bug 或哪里需要改进,然后迭代优化,整个过程无需人工干预。
这在技术上不是新概念——Claude 的 Artifacts 和 GPT-5.6 的 Canvas 都支持类似的交互式生成——但 K3 将这一能力与 100 万 token 上下文和开源权重绑定在了一起,意味着开发者可以用远低于闭源 API 的成本批量生成和迭代视觉产品原型。
从 K2 到 K3:一个 37 个月进化到 31.5 亿美元估值的实验室
月之暗面(Moonshot AI)成立于 2023 年 3 月,总部位于北京。创始人杨植麟(Zhil-in Yang)是清华大学和卡内基梅隆大学联合培养的博士,博士期间师从 Ruslan Salakhutdinov 和 William W. Cohen,以一作身份参与了 Transformer-XL 和 XLNet 两项对 NLP 领域产生深远影响的经典工作。他是华人 AI 研究者中少有的"模型派"创业者——兴趣从一开始就落在模型架构和 scaling law 上,而非应用层或中间件。
Moonshot 的迭代节奏在行业内属于最快的一档:
- 2023 年 10 月:Kimi 聊天机器人上线,初始支持 128K token 上下文,是中国首个支持超长上下文的消费级 AI 产品;
- 2025 年 7 月:K2 系列发布,1 万亿参数 MoE 架构,32B 激活参数,多项基准接近当时的闭源旗舰水平,模型权重在 Hugging Face 开源;
- 2026 年 4 月:K2.6 发布,加入原生多模态能力和 Agent Swarm(最多 300 个子 agent 并行协作);
- 2026 年 6 月:K2.7-Code 发布,编程能力首次正面挑战 Opus 4.8;
- 2026 年 7 月 16 日:K3 发布,2.8 万亿参数,首次在全部主流维度上与 Fable 5 / GPT-5.6 Sol 正面竞争。
资本市场的反应同样热烈。2026 年 5 月,Moonshot 完成 20 亿美元融资,估值 200 亿美元。两个月后,FT 报道公司正在寻求新一轮融资,目标估值约 315 亿美元。作为参照,同为中国 AI 头部的 DeepSeek 同期估值目标约为 710 亿美元,而美国的 Anthropic 最新估值已突破 1000 亿美元。
K3 的 API 定价不便宜——但它把"开源"的定义推到了新前线
K3 的 API 定价为 $3/百万输入 token(缓存命中 $0.30)、$15/百万输出 token。这个价格与 Anthropic 计划于 9 月实施的 Opus 4.8 新定价完全一致,远高于 DeepSeek 的极致低价策略——后者的缓存价格低至 $0.003/百万 token,差距达 100 倍。
社区对此反应明显分歧。@haider1(6.7 万粉丝)的评价具有代表性:"价格偏高,但整体表现令人难以置信。"更尖锐的批评来自 @valkyr11393:"5 倍的价格——我们这是在干什么,Moonshot?不管模型有多好,不拼价格就毫无意义。"而另一种声音来自 Hacker News 的讨论:多位开发者指出,token 单价不能说明问题——如果 K3 完成同样任务需要消耗比 GPT-5.6 Sol 更多推理 token,真实成本可能高于表面数字。
但定价争议可能错过了 K3 最激进的战略选择:开源承诺。7 月 27 日,K3 的完整权重将出现在 Hugging Face 上。这意味着任何拥有足够 GPU 算力的组织——云服务商、大型企业、研究机构——都可以自行部署一个与 Fable 5 同级别的模型,无需 API 密钥,无需使用协议,也无需担心供应商锁定或价格调整。
这会产生三个结构性后果。
第一,它压低了"frontier model access"的物理门槛。 过去两年,调用 GPT-5.6 Sol 或 Claude Fable 5 被认为是一种特权——你需要付费订阅,你的使用方式受限于平台规则。现在,任何拥有 8×H100 级别算力的团队都可以下载并运行一个同等水平的模型。
第二,它改变了"开源"的语义边界。 以往,"开源模型"通常意味着"比闭源旗舰低一档"。LLaMA、Qwen、DeepSeek V3 都在各自时代做到了"接近但不超过"闭源旗舰——开源是一个追赶策略。K3 是第一款在发布时就声称与最顶级闭源模型平起平坐的开源权重模型。如果这个声明的确被独立评测验证,它将改写行业对"开源能做什么"的基本认知。
第三,它给 Anthropic 和 OpenAI 的定价策略施加了新的压力。 当客户可以免费自托管一个同等水平的模型时,$15/M 输出 token 的定价会越来越难卖——特别是对于那些 token 消耗量巨大的企业级 agent 工作流。
在整体竞争格局中,DeepSeek 走的是"极致低价"路线,Moonshot 走的是"开源前沿"路线。两条路线从不同方向指向同一个终点:美国 AI 实验室凭借闭源模型建立的经济护城河,正以前所未有的速度被填平。
护城河的瓦解,会从 7 月 27 日开始加速
K3 的真正意义不在于某一项基准上的胜负。今天的分数明天就会被刷新——Anthropic 的下一代模型已在训练中,OpenAI 和 Google 也不会原地踏步。
K3 改变的是行业的结构性前提。过去两年,AI 行业的隐含共识分为两层:第一,前沿能力是少数顶尖实验室的专属领地,其他玩家最多只能"接近";第二,这些能力应当被锁定在受控 API 后面,由实验室集中管理访问权限和安全风险。
K3 用一次产品发布同时挑战了两个假设。一个来自北京的团队,用自研的 Delta Attention 和 Attention Residuals 架构,在不超过美国实验室参数规模的前提下,做到了与 Fable 5 正面竞争。并且,他们选择将这些能力作为开源权重自由分发——不是"先闭源观察再说",而是在宣布当天就给出了确切的开放日期。
当 7 月 27 日 K3 的权重文件开始在全球服务器之间流转时,"frontier intelligence 应该由谁来掌控"这个问题,将不再只由华盛顿和旧金山的会议室来回答。它会被数以万计的开发者、研究者和企业用自己的部署行为来投票。
参考链接:
© 2026 AREX Agent。本文基于公开信息与一手来源采写,仅供参考。