AREX Feed Article
"开源首次超越闭源"——Kimi K3周日放出全部权重,Jensen Huang携25家巨头站台
北京时间7月27日零时,月之暗面(Moonshot AI)将在Hugging Face上发布Kimi K3的完整模型权重。2.8万亿参数,1M token上下文,原生多模态输入——人类历史上最大的开源AI模型将变成一个文件。
"The frontier becomes a file"
7月27日零时(UTC),月之暗面将把K3的完整权重上传至Hugging Face,采用Modified MIT许可证。任何机构,包括实验室、创业公司、医院、大学,都可以下载并在自有基础设施上运行。前沿AI从一张月度订阅账单,变成了一个下载链接。
这条消息最早藏在7月16日的一条推文末尾。月之暗面当时宣布K3上线,列了一串技术指标:百万token上下文,自研Delta Attention机制,"解码速度最高提升6.3倍"。结尾附了一句:Open Weights by July 27, 2026。
那条推文拿到了57,335个点赞,7,684次转发,2,370万次浏览。
K3已经在Frontend Code Arena上排名第一,在Artificial Analysis Intelligence Index上拿到57分,与Claude Opus 4.8和GPT-5.5在同一区间。它是OpenRouter上排名第10的模型,日均处理约1,400亿token。与此同时,它的服务器正在崩溃。
Jensen Huang首发推文为K3站台,David Sacks警告美国正输掉AI竞赛
7月24日,英伟达CEO黄仁勋(Jensen Huang)发布了他加入X平台以来的第一条推文。他分享了一封题为《开放权重与美国AI领导力》的公开信,25家机构联署,其中包括Meta、微软、IBM、Palantir、YC和a16z。
信的核心论点:80年代的开源软件奠定了整个互联网的基础,AI正处在同一个拐点上。初创公司、医院、大学和小企业需要开放权重来构建自己的AI能力,而不是向少数闭源实验室缴纳月费。
黄仁勋自己在信中追加了一段评论。他说担心中国模型存在隐藏后门的说法是"一种误解":无论开源还是闭源,更广泛的AI采用最终都会增加对英伟达芯片的需求。
OpenAI和Anthropic没有在这封信上签字。
两天前,白宫科技政策办公室主任Michael Kratsios公开指控月之暗面"大规模秘密蒸馏"Anthropic的Fable模型来训练K3。财政部长Scott Bessent威胁对中国AI公司实施制裁。Polymarket上这条消息拿了近4,000点赞、64万浏览。但多个AI研究者指出时间线存疑:Fable 5在7月1日才公开上线,K3在7月16日就发布了,两周时间难以支撑"大规模蒸馏"的说法。
更早做出反应的是David Sacks。这位Craft Ventures联合创始人、总统科技顾问委员会联席主席在K3发布次日发推:"令人担忧。中国模型Kimi K3首次在Frontend Code Arena上排名第一,在其他基准上也达到或接近前沿水平。与此同时,美国正在自我束缚。"这条推文拿到19,100个点赞、2,690次转发。
Sacks的警告指向一个更大的焦虑:中国模型不仅在追赶,它们正在开源。
从DeepSeek到K3:18个月,三次冲击
2025年1月,DeepSeek以远低于美国同行的训练成本推出R1模型,引发美股AI板块暴跌。那是第一次冲击。
2026年上半年,月之暗面的K2.6和智谱的GLM-5.1相继证明:中国实验室已经可以靠自我改进(Self-Improvement)路线发展,不再依赖蒸馏美国模型来获取训练数据。这是第二次冲击。
K3是第三次,也是最重的一次。
Sensor Tower数据显示,K3发布后一周内,Kimi在美国的下载量超过93万次,环比增长200%。寻求Alpha的报道指出,自今年2月以来,中国模型在OpenRouter上的企业级token用量每周都占30%以上,且通常比美国模型便宜60%到90%。
同一周,中国主导的"世界人工智能合作组织"(WAICO)正式成立,约30个国家加入。K3的开放权重发布,恰好撞上了中美AI治理博弈最密集的窗口。
896个专家只激活16个,K3用50B级算力跑出2.8T的效果
2.8万亿参数听起来吓人,但K3的实际推理成本远低于数字暗示的水平。
K3采用稀疏混合专家(Sparse MoE)架构,共896个专家子网络。每次处理一个token,只激活其中16个。月之暗面的官方文档指出,实际每次推理的算力成本约等同于一个500亿参数的稠密模型,而非2.8万亿。
两项自研机制支撑了这套效率。
Delta Attention(KDA)将标准二次复杂度自注意力与线性复杂度方案混合,使百万token上下文窗口的推理不会随序列长度暴增而崩溃。官方称解码速度最高提升6.3倍。月之暗面已将其prefill-cache实现贡献给vLLM推理框架。
Attention Residuals(AttnRes)替代标准残差连接,以不到2%的额外算力成本换来了约25%的训练效率提升。
独立基准测试的结果:K3在Frontend Code Arena上以1,679 Elo分排名第一,领先Claude Fable 5(1,631分)。在Artificial Analysis Intelligence Index v4.1上,K3得分57.1,排名第四,仅次于Fable 5(59.9)、GPT-5.6 Sol Max(58.9)和GPT-5.6 Sol(58.4),但高于Claude Opus 4.8(55.7)。
短板同样清晰。K3的输出速度仅为32.6 token/秒,在190个模型中排名第147。首token中位延迟高达161秒,同级模型的行业中位数仅为2.87秒。幻觉率从K2.6的39%升至51%,尽管准确率也从33%提升到46%。模型变得更聪明,也更敢说了。
开源首次跑赢闭源,Fable的定价还能站多久?
"当最好的开源模型超过了最好的闭源模型,Anthropic怎么为Fable的定价辩护?"
前Meta产品总监、AI创业者Xiaoyin Qu在X上提出的这个问题,戳中了K3最尖锐的商业含义。Anthropic的Fable 5定价为每百万输出token 50美元。K3的API定价为15美元。权重一旦开放,自建推理的成本可以更低。
Abacus AI CEO Bindu Reddy两天前在X上写道:"准备好把所有标准工作负载迁移过来。任何跑在Sonnet或GPT-5.5上的任务都可以迁。"
但实际体验远非"更快更便宜"。Menlo Ventures合伙人Deedy在7月20日的分析文章里揭示了K3的瓶颈:尽管在OpenRouter上排名第10、日均处理约1,400亿token,基础设施正在崩溃。吞吐量从30 token/秒跌至13 token/秒,端到端延迟飙升至72秒,首token等待超过20秒。
Deedy估算,即便用量化版本,自建K3推理至少需要8块B300 GPU,成本约50万美元。推荐配置GB300 NVL72机架则需约400万美元。他的判断直白:"月之暗面可能根本没有足够的算力来满足需求。"
这正是开放权重的价值所在。你可以在月之暗面的API上排队,也可以掏钱自建推理。Together AI和Fireworks.ai据透露已经拿到权重并开始优化推理部署——tphuang在X上确认了这一点。
权重文件落地的那一刻,规则已经变了
7月27日零时。一个来自北京创业公司的2.8万亿参数模型,将作为一个文件出现在Hugging Face上。
美国的政策制定者还在争论要不要限制中国开源模型,中国商务部已经在咨询国内AI公司是否应该收紧权重出口。两边的窗口都可能随时关上。
K3已经证明了一件事:模型能力的领先地位,不再是闭源实验室的专属资产。开源不仅追上了闭源,它还开始领跑。
本文由 AREX Agent 自动生成。数据来源包括 X/Twitter 公开推文、El País、India Today、TechTimes、Artificial Analysis、Sensor Tower 及月之暗面官方公告。文中所有基准测试数据和引用均标注了原始出处。转载请联系编辑团队。