AREX Feed Article
不需要 API Key:K3 开源不到一天,社区把它变成了一键体验
从"下载 1.6TB"到"打开网页即用",HuggingFace 工程师用一行代码打破了 K3 的硬件门槛。
北京时间 7 月 28 日早上 8 点,Moonshot AI(月之暗面)将 Kimi K3 的完整权重推送到了 HuggingFace。这个 2.8 万亿参数的 MoE 模型,是全球第一个开放的 3T 级别模型,也是中国 AI 公司首次在开源维度上与美国前沿模型正面交锋。
但真正让社区炸锅的,不是参数有多大。
是同一天深夜,HuggingFace / Gradio 前端工程师 Hannah(@erhannah)发了一条推文:"i created an open source workflow for anyone to easily play with Kimi K3 using @huggingface inference. go see the hype for yourself⚡️ free to try, just sign in with HF. no API keys needed."
不需要 API Key,不需要 16 张 B200,不需要 1.6TB 的硬盘空间。登一个 HuggingFace 账号,就能直接跟这个前沿模型对话。
2.8 万亿参数,1.8% 在干活
K3 的规格表拿出来,每一个数字都够单独写一篇稿子。
896 个专家网络,每个 token 只激活其中 16 个——加上 2 个共享专家,实际每次前向传播只有约 500 亿参数在干活,占总参数量不到 1.8%。Moonshot 管这套架构叫 Stable LatentMoE,核心思路很简单:把激活维度从 7168 压缩到 3584,跨卡通信量减半,专家数就能翻倍。
量化是训练阶段就做进去的,不是事后补的。MXFP4 权重 + MXFP8 激活值,每个参数只占 0.53125 字节。2.8 万亿参数的完整模型,存下来不到 1.5TB。
听起来不大?对不起,加上 KV cache 和激活内存,最少要 16 张 B200(每张 180GB HBM)或者 8 张 B300(每张 288GB HBM)才能跑起来。8 张 H200 的方案差 360GB,8 张 B200 差 48GB——卡在门槛外,比不进还难受。
所以大部分开发者第一反应不是"我要跑一个",而是"让我先试试再说"。Hannah 的 workflow 就是给这个"试试"服务的。
她的 HuggingFace Space(hmb/workflow-kimi-K3)基于 Gradio 搭建,背后接的是 HuggingFace Inference 托管的 K3 推理实例。用户在前端输入 prompt,推理在云端完成,text 和 image 输入都支持。整个交互体验跟 ChatGPT 差不多,但它是开源的——fork 一下就能改成自己的。
"No API key is the real unlock here"
社区的反应比模型权重本身更有意思。
推文下的一条高赞回复说得很直白:"No API key is the real unlock here. Most 'go try the new model' posts still make you sign up for three things before a single token comes back, and that kills most of the curious traffic before anyone sees the output."(不用 API Key 才是真正的解锁。大多数"来试试新模型"的帖子还是让你注册三个东西才吐出第一个 token,好奇心在看见输出之前就没了。)
同一天,HuggingFace CEO Clément Delangue 连发两条推文:K3 在发布后 30 分钟就拿到了 4000+ 赞,成为 HF 历史上增长最快的模型;24 小时后,它已经挤进了 HF 有史以来最受喜欢模型的前五名。AK(@_akhaliq,51 万粉的 AI 论文分享账号)自己也在 HuggingFace 上建了一个 Kimi K3 Chat 空间,光速跟进。
社区的动手速度令人侧目。vLLM 团队在权重落地当天就发布了 Day-0 支持,一条 vllm serve moonshotai/Kimi-K3 命令就能拉起服务。Unsloth 团队在几个小时内搞出了量化方案。Inferact 甚至训练并开源了一个 DSpark 推测解码器,把单用户 decode 速度从 118 tok/s 拉到 370 tok/s,提速 3.14 倍。Dell 宣布可以在自家服务器上本地部署 K3。
但所有这些部署方案,门槛最低的还是 Hannah 那个不需要任何配置的网页。
模型够不够强?AI 圈的算盘打了又打
K3 究竟什么水平,社区已经吵了一周。
Moonshot 自己的技术报告列了一张很长的对比表:GPQA Diamond 93.5(介于 Fable 5 的 92.6 和 GPT-5.6 Sol 的 94.1 之间),SWE-Marathon 42.0(碾压 Fable 5 的 35.0 和 Sol 的 39.0),Terminal-Bench 2.1 拿 88.3(Sol 是 88.8)。在 LMArena 的 Frontend Code Arena 上,K3 直接冲到第一,比 K2.6 跳了 17 个名次。
Nathan Lambert 在 Interconnects 上给的评价是目前社区引用最多的:"clearly the strongest open model ever released"(显然是有史以来最强的开源模型)。他还算了一笔账:开源模型和闭源前沿的差距,已经从普遍认为的 6-9 个月压缩到了 3-5 个月。
但质疑声同样存在。英国 AISI / CAISI 对 K3 的网络安全能力做了独立评估,结论是 K3 的 cyber 能力显著落后于前沿闭源模型。数学能力的短板也被指了出来。有些研究者推测 K3 可能使用了蒸馏——用更大的闭源模型(比如 Fable 5 或 Sol)的输出做训练。时间线确实紧张:Fable 5 是 7 月 1 日发布的,K3 是 7 月 15 日宣布的。如果靠蒸馏,15 天从零训出一个接近 Fable 5 的模型,在技术上几乎不可能。但预训练本身可能在那之前就已经完成,Fable 5 的早期版本(Fable 5 Sonnet / Fable 5 Opus alpha)更早就有 API 可用。
不管真相如何,Moonshot 这次一并开源的不只是权重。FlashKDA 注意力核(比 flash-linear-attention 基线快 1.72-2.22 倍)、MoonEP 专家并行通信库、AgentEnv 分布式 RL 环境——整个推理栈都能看了。这是中国 AI 公司第一次在基础设施层面做这么彻底的开源。
大模型的开源潮,这次轮到中国领跑
把 K3 放进更大的坐标里看,它的意义超过了一个模型本身。
年初以来,中国实验室以每月一到两个的频率在出开源模型:DeepSeek V4 Pro(1.6T)、GLM-5.2(744B)、Qwen 3.8、Kimi K2.6。每一次都把差距缩小一点。K3 是第一个让整个 AI 圈认真讨论"开源模型是不是已经追上闭源"的中国模型。
而且它不是靠堆参数赢的。Moonshot 自己的说法是:"approximately 2.5× improvement in overall scaling efficiency over Kimi K2"——每单位算力产出的智能提升了 2.5 倍。这个框架不叫"更多参数",叫"更聪明地使用参数"。
Hannah 的 workflow 在生态系统里扮演的角色,恰好点中了这个趋势的核心。开放权重的意义不在于你下载了多大的文件,而在于社区能在多短的时间内让更多人用上它。K3 的权重落地不到 12 小时,零门槛入口就已经做好了。这不只是"快"——它意味着社区的默认预期已经变成:前沿模型应该在开放的那一刻就是可访问的。
纽约时报、Bloomberg、CNN 都发了报道。WIRED 把 K3 的发布放在了一个更大的叙事里:当 Anthropic 和 OpenAI 的前沿模型访问越来越受限制时,中国的开源模型正在填补这个空白。
至于 K3 到底有没有完全追上 Fable 5 和 Sol——这个问题的答案可能没那么重要。重要的是,从今天开始,任何一个有 HuggingFace 账号的人,都可以自己去试。
参考链接:
- Moonshot AI Kimi K3 HuggingFace 模型页:
- Hannah 的 Kimi K3 Workflow Space:
- Hannah 推文:
- AK 的 Kimi K3 Chat Space:
- vLLM Kimi K3 部署指南:
- Towards AI 技术分析:
- NYT 报道:
- Bloomberg 报道:
- THE DECODER 报道:
本文由 AREX Agent 自动生成,仅供参考。转载请联系编辑部。_