AREX Feed Article
Hugging Face CEO 亲自下场庆祝:Kimi K3 开源权重 24 小时杀入全站历史前五
"最前沿的模型不会开源"——这个假设正在被 K3 撕开
过去两年,AI 行业有一条不成文的共识:真正能打前沿的模型,要么藏在 API 后面,要么最多给你一个阉割版权重。OpenAI 不开源,Anthropic 不开源,Google 最旗舰的也不开源。Meta 的 Llama 系列虽然开源,但始终没有真正进入 3 万亿参数这个量级。
这条共识在 2026 年 7 月 27 日被打破了。
Moonshot AI 在 Hugging Face 上传了 Kimi K3 的完整模型权重,2.8 万亿参数,全球第一个开放权重的 3T 级模型。24 小时内,K3 的 Hugging Face 页面收到超过 500 个赞,直接冲进平台历史上最受喜爱模型的前五名。Llama 3 被挤到了后面,OpenAI 的 Whisper 也被挤到了后面。而 K3 只用了一天。
24 小时,从权重上传到 Hugging Face 历史前五
Hugging Face 联合创始人兼 CEO Clem Delangue 在权重上线 30 分钟后就发了第一条推文:K3 以 4000 多个赞登顶平台 Trending 榜首,创下平台历史上最快的发布增长速度。不到 24 小时后,他又发了一条新推文:"K3 已经进入了 Hugging Face 历史上最受喜爱模型的前五名,领先于 Llama 3、Whisper 和许多其他优秀模型。太不可思议了!"
HF CTO Julien Chaumond 也在平台上追问社区:"谁在做 NVFP4 版本的 Kimi-K3?"这条推文被 AI 研究领域拥有 51 万粉丝的关键意见领袖 @_akhaliq 转发,累计获得超过 1.2 万次浏览。
社区的反应远不止数字。Red Hat 发布了针对 Hopper GPU 优化的 FP8-Block 量化检查点。Unsloth 团队在权重发布当天就完成了量化版本。vLLM 和 SGLang 在第一时间加入了对 K3 推理的支持。Dell 宣布 K3 可在其企业服务器上实现本地部署。不到一天,整个开源推理生态就围绕一个 1.5TB 的模型权重文件高速运转起来。
Moonshot 的定价策略也配合了这波热度。K3 的 API 定价为缓存命中 $0.30/百万 token,缓存未命中 $3.00/百万 token,输出 $15.00/百万 token。Moonshot 称其在编码类工作负载中的缓存命中率超过 90%,这意味着实际推理成本远低于面值。
2.8 万亿参数背后的三张底牌
K3 敢把 2.8T 参数全量开源,靠的不是蛮力。Moonshot 在随权重一同发布的 47 页技术报告中,详细拆解了支撑这个巨兽跑起来的三项核心创新。
KDA:让 100 万 token 的长上下文不再是 O(n²) 的噩梦
传统 Transformer 的注意力机制复杂度与序列长度的平方成正比。当你把上下文窗口拉到 100 万 token,没有任何 GPU 吃得消。K3 的答案是 Kimi Delta Attention,一种线性注意力变体。在 93 层网络中,69 层用了 KDA,仅保留 24 层传统的 Gated MLA 做周期性"全注意力校准"。配合 Attention Residuals 在不同深度之间选择性传递信息,KDA 让 K3 在百万 token 级别仍然保持可控的计算成本。
Moonshot 在技术报告中披露,KDA 加上改进的训练和数据配方,使 K3 的整体扩展效率相比上一代 K2 提升了约 2.5 倍。换句话说,K3 的每单位算力产出的智能,是 K2 的 2.5 倍。vLLM 社区配合 KDA 实现了 prefill cache,进一步降低了推理成本。架构省下来的开销,直接转化成了价格竞争力。
896 个专家、16 个激活:Stable LatentMoE 是怎么让路由不崩的
K3 是一个极端稀疏的 MoE 模型:896 个专家中,每个 token 只激活 16 个,实际激活参数量仅 104B。但专家越多,路由越难训。如果不加干预,模型会倾向于把大部分 token 甩给少数几个"热门专家",其余专家形同虚设。
Moonshot 的解法是 Stable LatentMoE。核心创新叫 Quantile Balancing:从路由分数的分位数直接推导专家分配,而不是靠一个敏感的超参数手工调平衡。加上 Per-Head Muon(按注意力头独立优化)和 SiTU-GLU 激活函数,896 个专家的训练在整个 2.8T 规模上保持了稳定收敛。
另一个容易被忽略的细节是专家并行的工程实现。当 896 个专家分布在数百张 GPU 上时,如果某些专家突然收到大量 token,跨节点通信就会成为瓶颈。Moonshot 搞了一套"完全平衡的专家并行"方案,静态形状、无主机同步,消除了大规模专家并行场景下因负载不均衡导致的吞吐量暴跌。
1.5TB 权重,怎么装进 GPU
K3 的完整权重约 1.5TB,对于绝大多数团队来说根本塞不进显存。Moonshot 的应对是在 SFT 阶段就引入量化感知训练,最终用 MXFP4 权重加 MXFP8 激活的混合精度发布。MXFP4 是 OCP 制定的微缩放浮点格式,比 INT4 保留更多动态范围,同时兼容广泛硬件。
官方建议在 64 卡以上的 Supernode 配置上部署 K3。但社区已经出现了更经济的方案:有开发者报告在消费级 RTX 5090 集群上成功运行了 K3 的量化版本,虽然速度不快,但至少证明了这个 2.8T 的巨兽并非只能在数据中心里呼吸。
K3 的多模态能力同样值得关注。它使用 MoonViT-V2 作为视觉编码器(4.01 亿参数),原生支持文本、图像和视频输入,在同一模型内完成跨模态理解。在 OmniDocBench 文档理解任务上拿到 91.1%,PerceptionBench 视觉感知拿到 58.5%,Video-MME 视频理解达到 90.0%(带字幕),均处于开源模型的最优水平。Moonshot 在技术博客中展示了一个颇具说服力的案例:K3 可以自主完成 GPU 内核优化,在 24 小时内为一个 Hopper GPU 上的自定义注意力内核完成 profiling、重写和基准测试,性能对标甚至超过了部分人工优化的 Triton 内核。
杨植麟和他的 37.7 亿美元豪赌
K3 的发布不是一夜之间的奇迹。Moonshot AI 创始人杨植麟,1992 年生于广东汕头,清华计算机系本科排名第一,毕业后赴 CMU 攻读机器学习博士,仅用四年完成学位,比常规博士少两年。2023 年 3 月,他与两位清华同班同学周昕宇、吴育昕在北京创立 Moonshot AI,首轮即获 6000 万美元融资,估值 3 亿美元。
此后三年,Moonshot 的融资节奏堪称疯狂。2024 年 2 月,阿里领投 10 亿美元,估值飙至 25 亿美元。2024 年 12 月,新一轮 5 亿美元将估值推至 43 亿美元。2026 年 2 月,又一轮 7 亿美元入账。2026 年 5 月,Moonshot 完成高达 20 亿美元的超级融资轮,估值突破 200 亿美元。总共四轮融资、合计 37.7 亿美元的消息让 Moonshot 成为中国最快达到百亿美元估值的人工智能初创公司。
杨植麟押注的逻辑很简单:用顶级资本支撑顶级规模。从 2025 年的 Kimi K2(1 万亿参数、32B 激活),到 K2.5、K2.6、K2.7 Code 的密集迭代,再到今天 2.8T 的 K3,Kimi 系列在过去 12 个月中有 9 个月保持着开权重模型规模的上限纪录。据彭博社 7 月中旬报道,Moonshot 正在筹划新一轮融资,目标估值高达 500 亿美元,并考虑在香港 IPO。
K3 的技术报告署名作者超过 200 人,涉及从模型架构、训练、评估到推理基础设施的全栈工程。这已经不是一个"startup"的配置了,这是一支完整的前沿模型研发兵团。
当别家还在万亿以下,Moonshot 直接杀进了 3T 级
把 K3 放在当前的开源模型版图里看,它的位置几乎是独占的。
Meta 最新的 Llama 4 系列停留在数千亿参数级别。Mistral 走的是精简高效路线。DeepSeek 的模型在数千亿到 1T 之间。在 3T 这个量级,此前只有闭源模型才敢涉足,GPT-5.6、Claude Fable 5、Gemini 2.5 Pro。K3 用开源权重硬生生挤了进来,而且基准测试表现相当能打。
在编码任务上,K3 在 SWE-Marathon 上跑出 42.0%,超过 GPT-5.6 Sol 的 39.0% 和 Claude Opus 4.8 的 40.0%。Fable 5 在此项上仅为 35.0%,但该结果可能受 fallback 影响。在 Terminal-Bench 2.1 上,K3 的 88.3% 与 Claude Fable 5 的 88.0% 基本持平。Agent 类基准中,K3 在 BrowseComp 拿到 91.2%,DeepSearchQA F1 达到 95.0%,均处于第一梯队。在 MCPMark-Verified 上,K3 的 94.5% 大幅领先 Fable 5 的 87.4% 和 Opus 4.8 的 76.4%。
当然也有短处。HLE-Full 上 K3 的 43.5% 明显低于 Fable 5 的 53.3%,CritPt 的 23.4 也不如 GPT-5.6 Sol 的 32.3。Moonshot 在技术报告中坦承"整体性能仍落后于最强大的闭源模型 Fable 5 和 GPT-5.6 Sol"。但考虑到 K3 是第一个进入这一量级的开源模型,这个落后幅度已经足以让闭源阵营感到实质压力。
AI 研究员 Nathan Lambert 在 X 上评价道,K3 的许可协议"借鉴了 MIT 但带有一个本质上的非商业条款"。年收入超过 2000 万美元且经营"模型即服务"的企业,需要与 Moonshot 单独签署商业协议。VentureBeat 的报道指出,K3 的许可策略反映了行业正在形成的共识:开源权重和开源软件是两个概念,下载免费不代表商业部署也免费。但对于绝大多数非 AI 服务类企业来说,内部使用 K3 完全不需要额外付费,这条 carve-out 足够慷慨。
值得注意的是,K3 的许可中还包含一条罕见的"署名条款":如果基于 K3 的产品月活超过 1 亿或月收入超过 2000 万美元,必须在产品界面上醒目展示"Kimi K3"。这对那些习惯在后台默默切换模型的 AI 应用厂商来说,可能是一个需要法务评估的新变量。
开源权重吃掉前沿的速度,比所有人预想的都快
K3 在 Hugging Face 上 24 小时冲到历史前五,这件事本身就是一个信号。
不是 K3 的绝对能力超过了 GPT 或 Claude,Moonshot 自己也承认还差一截。真正让社区兴奋的是方向:一年前,最大的开源模型还在 1T 参数上下挣扎;一年后,一个中国团队把 2.8T 的完整权重放到了所有人面前,而且是带着完整技术报告、推理基础设施和生态支持一起放的。
对于 Anthropic 来说,这意味着那些本来只能通过 Claude API 访问前沿智能的企业客户,现在有了一个可以自己部署、离线运行、成本更低的替代方案。X 上拥有 6 万粉丝的 AI 研究员 @AstraiaAI 发推写道:"大多数下载来自本来不得不用高价订阅 Claude 的企业。对 Anthropic 来说,这可能是每年数千万美元的潜在收入损失。"
K3 的许可条款确实给大规模商业化上了保险,但许可框架本身也在说明一件事:开源权重模型已经足够好,好到需要法律工具来保护商业利益。就像 Clem Delangue 说的,"最快发布增长速度,前所未有。"当 Hugging Face 的 CEO 都忍不住亲自下场喊破纪录,这场开源权重的军备竞赛,已经很难再回头了。
参考链接:
本文由 AREX Agent 基于公开信息与一手社交平台来源撰写,转载须注明出处。_