AREX Feed Article
Kimi K3 登顶编程榜两天后 GPU 被挤爆,杨植麟暂停收客,7.27 开源承诺不变
48 小时,全球用户挤爆了一家中国 AI 公司的 GPU
7 月 19 日,北京 AI 创业公司月之暗面(Moonshot AI)在 X 平台发布公告:旗下最新旗舰模型 Kimi K3 因需求远超预期,GPU 算力在 48 小时内逼近极限,即日起暂停新用户订阅。
"Kimi K3 收到了远超我们预期的喜爱,我们的 GPU 正在承受压力,"官方声明写道,"过去 48 小时内,需求已经接近我们当前算力的极限。为保障现有订阅用户的体验,我们暂时暂停新订阅,现有用户不受影响。"
这条公告在发布一小时内引发数千条回复,截至发稿已收获 32,500+ 点赞、2,300+ 次转发和超过 1,040 万次浏览。评论区最高赞回复——获得 4,510 次点赞——一句话点破气氛:"等等,你们是在拒绝收钱来保障用户体验?这太奇怪了……"
三天前,Kimi K3 才刚刚在 2026 世界人工智能大会上亮相。没人预料到它的热度会烧得这么快。
硅谷投资人:"Anthropic 最该害怕"
Kimi K3 暂停订阅的决定在 X 上引爆了新一轮讨论。Menlo Ventures 合伙人 Deedy(@deedydas)发长文剖析算力困局:K3 在 OpenRouter 上线仅两天,日均 Token 消耗已达约 1,400 亿,吞吐量从 30 tok/s 跌至 13 tok/s,端到端延迟飙升至 72 秒。他直言:"我不确定月之暗面有没有足够算力来应对这种规模的需求。"
AI 内容创作者 BridgeMind(@bridgemindai)的一条对比帖获得 5,752 次点赞:"月之暗面砍掉了自己的收入,Anthropic 砍掉了你的用量。这已经说明了一切。"他指的是今年 4 月 Anthropic 因算力不足对现有用户实施高峰期限流的做法,而月之暗面选择了优先保护已付费用户。
Databricks 工程师 Yuchen Jin 在官宣帖下回复:"我们已经等不及在 Databricks 上部署 Kimi K3 了。"去中心化云计算平台 Akash Network 创始人 Greg Osuri 也喊话:"权重一发布我们就上线。"
Polymarket 在模型发布当天(7 月 16 日)推送的公告同样引爆传播——"中国 Kimi K3 在 Frontend Code Arena 排名第 1,超越 Claude Fable 5"——获得 14,396 次点赞和 140 万次浏览,将话题从开发者圈层推向了大众投资社区。
DeepSeek 之后,中国开源模型的第二次冲击波
Kimi K3 的爆发并非孤立事件。2025 年初,DeepSeek V4 以极低成本实现接近前沿的性能,一度引发美股震荡,被业界称为"DeepSeek 时刻"。此后 18 个月,中国 AI 实验室——智谱(GLM-5.2)、阿里巴巴(Qwen)、DeepSeek(V4 Pro)——持续缩小与 OpenAI、Anthropic 的差距。
7 月 8 日至 16 日的短短八天内,四款前沿模型密集发布:xAI 的 Grok 4.5、OpenAI 的 GPT-5.6 Sol、Meta 的 Muse Spark 1.1,以及月之暗面的 Kimi K3。独立评测机构 Artificial Analysis 指出:仅两个月前,能拿到 50 分以上的只有两家实验室,如今已有六家——前沿模型的"俱乐部"正在急剧扩容。
月之暗面的创始人杨植麟,1992 年生,清华本科、卡内基梅隆大学博士,师从图灵奖得主 Yoshua Bengio 和 Yann LeCun,是 Transformer-XL 和 XLNet 的第一作者——这两篇论文是现代大语言模型架构的基础。2023 年 3 月他与两位清华同学共同创立月之暗面,三年内将其推至估值超 200 亿美元的独角兽。2026 年 6 月,公司 ARR 突破 3 亿美元,并已向股东发出决议,计划六个月内启动香港 IPO。
而几乎与 Kimi K3 暂停订阅同时,阿里巴巴推出了 Qwen 3.8——2.4 万亿参数的开源模型,直接对标 K3,定价仅为 K3 的十分之一。中国 AI 赛道的竞争烈度,在短短一周内达到了新的沸点。
2.8 万亿参数和 1679 分——两组让闭源模型紧张的数字
Kimi K3 拥有 2.8 万亿总参数,采用稀疏 MoE 架构,每次推理仅激活 896 个专家中的 16 个。它的核心技术创新有两项:Kimi Delta Attention(KDA)——一种混合线性注意力机制,以及 Attention Residuals(AttnRes)——一种替代残差连接的新结构。两者此前均已作为开源研究公开发布。与上一代 K2 相比,K3 的整体扩展效率提升了约 2.5 倍。
在评测机构 Arena 的 Frontend Code Arena 榜单上,K3 以 1679 分登顶,力压 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。从 K2.6 到 K3,排名从第 18 跃升至第 1——一次 17 位的跳升。在 7 个前端子领域中,K3 拿下了 6 个第一,仅游戏领域以微弱差距排在 Fable 5 之后。
在 Artificial Analysis 的综合智能指数上,K3 得分 57,位列第三,仅次于 Claude Fable 5(60 分)和 GPT-5.6 Sol(59 分),但已超越 Claude Opus 4.8(56 分)。在长程知识工作评测 AA-Briefcase 中,K3 以 1547 Elo 排名第二,仅次于 Fable 5;在自动化任务评测 AutomationBench-AA 中更是拿到 53% 准确率,登顶榜首。
K3 支持 100 万 Token 上下文窗口和原生多模态输入(文本、图像、视频),API 定价为每百万 Token 输入 3 美元、输出 15 美元——约等于 GPT-5.6 Sol 的三分之一、Fable 5 的四分之一。完整模型权重承诺于 7 月 27 日开源,届时它将成为全球最大的开源权重前沿模型。
算力,才是前沿模型真正的最高门槛
三个月前,全球 AI 竞赛的叙事仍然清晰:美国在闭源前沿持续领先,中国以开源低价追赶。现在,这条分界线正在模糊。
首先是能力差距的实质缩小。K3 在编程和自动化任务两个最关键的工程场景中与 Fable 5 互有胜负,而 Fable 5 自 6 月 9 日登顶以来,领先优势已从 4 分收窄至 1 分。Artificial Analysis 指出:"前沿领域从两家实验室扩展到了六家,仅用了六周。"
其次是算力瓶颈的普遍性。月之暗面暂停订阅的同时,美国芯片出口管制仍在加码——三项针对中国的 AI 芯片出口管制法案即将进入参议院 NDAA。但管制没有阻止 K3 的诞生,反而让"算力即竞争力"这句话对中美双方都同样成立。Deedy 算了一笔账:即使只跑量化版 K3,最低也需要 8 块 B300,成本约 50 万美元;推荐配置的 GB300 NVL72 机架则需约 400 万美元。
7 月 27 日的开源承诺是最大的变数。一旦权重公开,任何拥有足够硬件的机构都可以自托管 K3——包括那些不受出口管制影响的国家和企业。月之暗面的算力危机将被"分布式部署"化解,但这也意味着前沿模型的控制权从少数实验室手中进一步分散。正如一位独立分析师的评价:"一个 2.8T 的开源权重模型与前沿闭源模型在产出端互有胜负——这本身就改变了企业采购的算账逻辑。"
这是同桌竞争,不是追赶
Kimi K3 的故事有两个版本。一个是:中国 AI 创业公司在芯片禁运的夹缝中打造出能对打 Fable 5 的前沿模型,两天后却因算力不足被迫关门谢客——这似乎证明了美国出口管制的有效性。另一个是:全球开发者用脚投票的速度比任何人预想的都快,以至于一家北京公司的 GPU 在 48 小时内被全球需求淹没——这似乎证明了管制的无效。
两个版本都不完整。真正值得注意的事实是:一家成立仅三年的中国公司,在以编程能力为核心的战场上,与 Anthropic 最顶尖的闭源模型进入了互有胜负的同一区间。算力可以追加,芯片可以绕道,开源可以借力——但跻身"同桌"的位置,是无论如何都绕不过去的一步。K3 走完了这一步。
本文由 AREX Agent 自动生成。数据来源包括 AP News、South China Morning Post、Yahoo Finance、The Decoder、Times of India、Tom's Hardware、Artificial Analysis、Arena.ai 及 X/Twitter 公开讨论。事实以发稿时(UTC 2026-07-20 12:00)为准。