AREX Feed Article
"爱太多,GPU 不够用":Kimi K3 上线48小时卖断货,杨植麟按下 AI 史上最贵的暂停键
TL;DR —— 7月19日下午,北京 AI 公司 Moonshot AI 宣布暂停 Kimi K3 的新用户订阅,原因是上线48小时内涌入的需求"已接近当前 GPU 算力的极限"。这是全球首个因为需求太旺而主动停止收钱的前沿 AI 模型服务。与此同时,Moonshot 宣布将原有统一会员拆分为「Kimi Membership」(聊天/工作)和「Kimi Code Membership」(编程)两个独立套餐。暂停公告推文在半天内飙升至 2.4 万点赞、550 万次浏览。白宫 AI 顾问 David Sacks 在此前一天已连发两条推文表达忧虑。消息传出后,TSMC 当日跌 6%,费城半导体指数跌 4%,全球半导体板块连续两天集体下挫。
"Kimi K3 has received far more love than we expected, and our GPUs are feeling it" —— 这句话,值一个时代的注脚
7月19日下午 14:52(UTC),Moonshot AI 旗下官方账号 @Kimi_Moonshot 在 X 平台发布了一条措辞罕见的公告:"Kimi K3 收到了远超我们预期的爱,我们的 GPU 正在深切感受它。"
过去 48 小时,新模型接入的需求已经逼近公司当前算力容量的极限。为了保护现有订阅用户的体验,Moonshot 做出了一个在 AI 商业史上几乎找不到先例的决定:暂停所有新订阅,将全部算力优先分配给已付费用户。公告明确写道——「现有订阅用户不受影响。我们正在以最快速度扩容,并将分批重新开放新订阅名额。」
公告同时宣布了一项结构性的会员体系调整:将原来的统一套餐拆分为「Kimi Membership」(覆盖 Kimi Web、App 和工作台)和「Kimi Code Membership」(专注于编程工作流)。这是一种务实的算力匹配策略——编程 Agent 持续读取仓库、编辑文件、跑测试半小时所消耗的算力,和普通聊天用户发一条摘要指令,完全是两个量级的工作负载。
这条暂停公告迅速成为当日 X 平台最受关注的 AI 话题。截至发稿时,推文已积累 2.4 万点赞、1735 次转发、1396 条引用和超过 550 万次浏览。评论区排在最前面的一条回复——"等等,所以你是在拒绝收钱,就为了给用户更好的使用体验?你没在把最好的模型从套餐里拿掉,也没在忽悠用户说这是为他们好?……奇怪……"——以 2500 赞高居榜首,精准戳中了整个行业对「算力瓶颈该如何处理」的敏感神经。
而在三周后——7月27日,Kimi K3 的完整模型权重将正式开源。届时,任何拥有足够 GPU 基础设施的开发者和机构都可以自行部署和运行这个模型。这也是 Moonshot 公告下另一条高赞评论的核心诉求:"我们在等其他服务商上线,请尽快发布权重。"
David Sacks 连发两推,桥脑直接对比 Anthropic:同样的算力瓶颈,两种完全不同的选择
Kimi K3 的冲击波早在订阅暂停之前就已经抵达华盛顿。
7月17日——K3 发布不到24小时——白宫科技顾问委员会联合主席、知名投资人 David Sacks(@DavidSacks,162 万粉丝)在 X 平台发了一条长文:"这令人担忧。有史以来第一次,一个中国模型 Kimi K3 在 Frontend Code Arena 上拿下了第一名,并在其他基准测试中达到或接近前沿水平。"他紧接着将矛头指向了美国的监管环境——"政客和官僚们在禁止新建数据中心、堆砌州级监管、推动成立新的联邦机构来预审前沿模型……这就是你输掉 AI 竞赛的方式。"
这条推文在 48 小时内积累了 18,938 次点赞、2,643 次转发和 368 万次浏览,在评论区引发了关于中美 AI 竞争、开源与闭源、政府监管等议题的激烈争论。Palantir 联合创始人 Joe Lonsdale(30.6 万粉丝)在回复中写道:"讽刺的是他们通过窃取知识产权做到了这一点,而我们却没有关注那部分。"
Sacks 在前一天——7月19日——又发了一条跟进:"Kimi K3 刚刚修复了 15 个 Codex 和 Fable 因为'网络护栏'而拒绝处理的关键安全漏洞。没有理由在美国模型被限制处理的任务上让中国模型毫无障碍地执行。我们只是在让自己失去竞争力。"这条推文获得了 2,102 次点赞。
但最尖锐的对比来自 AI 开发者社群。BridgeMind(@bridgemindai,4.6 万粉丝)发布了一条引爆讨论的对比分析:"Kimi K3 现在的速度比今早快了 100%。为什么?Moonshot 撞到了算力天花板,但选择停止销售新订阅,而不是限制现有用户的用量。所有套餐:全部售罄。故意的。当 Anthropic 在 4 月遇到同样的墙时,他们在高峰期把现有用户的用量砍掉了 50%。Moonshot 砍了自己的收入。Anthropic 砍了你的用量。"
这条推文获得了 1,267 次点赞和 76 次转发。评论区迅速形成了鲜明站队:一边是称赞 Moonshot"把用户放在收入前面"的声音,另一边则有人指出 Moonshot 的用户基数远小于 Anthropic,等它做到同等规模再评价不迟。
Databricks 的 Yuchen Jin(21.9 万粉丝)在暂停公告下回复:"我们很期待很快在 Databricks 上提供 Kimi K3 服务。"去中心化云计算平台 Akash Network 创始人 Greg Osuri(5.1 万粉丝)也留言:"权重一发布,Akash 马上上线。"
而拥有 34.5 万粉丝的知名投资人 Mike Alfred 只回了一句——"等等……所以你是在说你们算力不够?"——这一问,收获了 1,017 个赞。
18 个月前掉到中国第七,杨植麟用 2.8 万亿参数杀回牌桌
要理解 Kimi K3 订阅暂停的真正分量,需要回到 Moonshot AI 的「至暗时刻」。
这家公司由清华毕业、曾在 Google 和 Meta 从事 AI 研究的杨植麟于 2023 年创立。早期凭借长文本分析和 AI 搜索功能迅速积累用户,一度跻身中国 AI 应用月活前三。到 2026 年初,Moonshot 已累计融资约 20 亿美元,由阿里巴巴和腾讯等巨头背书,估值从 25 亿美元攀升至超过 200 亿美元,并被报道正在寻求高达 300 亿美元估值的新一轮融资。
然后 DeepSeek 出现了。2025 年 1 月,DeepSeek 发布的低成本 R1 模型彻底改变了中国 AI 市场的竞争格局。Moonshot 是受冲击最严重的公司之一:旗下 Kimi 产品的月活用户排名从中国第三跌至第七,几乎被挤出主流视野。
正是在这种压力下,杨植麟做出了一个关键战略转向:开源。从 2025 年 7 月的 Kimi K2 到 2026 年 1 月的 K2.5,Moonshot 逐步积累开源模型的工程经验。K3 是这个转型路线的总攻——一个 2.8 万亿参数的巨型模型,参数规模比 DeepSeek V4 Pro 高出约 75%,被定位为全球首个"3T 级开源模型"。
7 月 16 日的首发公告推文至今保持着一组令人瞠目的数据:56,307 次点赞、7,539 次转发、22,640,543 次浏览、3,315 条引用——对于一家此前在国际市场几乎零存在感的中国 AI 公司来说,这组数据本身就是一次核爆级别的品牌突围。
更微妙的背景板是 Qwen。就在 Kimi K3 暂停订阅的同一天(7月19日),阿里巴巴旗下 Qwen Cloud 发布了 Qwen 3.8,一台 2.4 万亿参数的开源模型,声称"仅次于 Fable 5"。全球 AI 竞赛的热度,正在以周为单位重新定义。
896 个专家只激活 16 个,训练效率提升 2.5 倍——这不是 brute force,这是工程智慧
Kimi K3 之所以能在上线 48 小时内耗尽 GPU 算力,首先是因为它确实有东西可卖。
K3 基于混合专家架构(MoE),总计 896 个专家,每个 token 只激活其中 16 个——这种极高的稀疏度意味着模型在推理时实际只调动一小部分参数,大幅降低了单个请求的算力消耗。但与 MoE 的"省算力"形成对比的是两个自研架构创新:
Kimi Delta Attention(KDA):一种混合线性注意力机制,据官方数据,在百万 token 上下文中实现最高 6.3 倍的解码加速。对于需要处理超长代码库或文档的 Agent 场景,这个数字直接意味着用户等待时间从几分钟压缩到几十秒。
Attention Residuals(AttnRes):一种残差连接的即插即用替代方案,以不到 2% 的额外计算成本,带来约 25% 的训练效率提升。与 KDA 和 MoE 稀疏化叠加后,K3 的整体扩展效率相比前代 K2 提升了约 2.5 倍——换句话说,同样的算力预算,K3 可以"烧"出更多的智能。
在基准测试层面,几个关键数字勾勒出了 K3 的竞争身位:
- Frontend Code Arena:以 1,679 分登顶,领先 Anthropic Claude Fable 5(1,631 分)
- GDPval-AA v2(覆盖 44 个职业、9 大行业的真实任务评测):1,687 分,排名第三,仅次于 Fable 5 Max(1,815)和 GPT-5.6 Sol Max(1,747.8)
- AA-Briefcase(长时间知识工作 Agent 评测):1,527 分,排名第二,超越 GPT-5.6 Sol Max(1,495),仅次于 Fable 5 Max
- BrowseComp(高难度长程信息检索):91.2 分(满分 100),刷新最先进纪录
Moonshot 表示,这些成绩是在单 Agent 设定下、利用 100 万 token 上下文窗口直接完成的,没有使用任何上下文压缩或多 Agent 协作技巧——这暗示原始上下文长度在结合强大检索能力时,可能比精巧的多 Agent 变通方案更有效。
定价策略同样激进:API 每百万输入 token 收费 3 美元,输出 15 美元,缓存输入低至 0.30 美元。与 Anthropic Claude Fable 5 的每百万输入 10 美元、输出 50 美元相比,价差高达 3 到 5 倍。对于每周都在烧 token 做前端界面的开发者来说,一个更便宜但刚赢了前端排行榜的模型,不需要采购部门来评估吸引力。
TSMC 一日跌掉 6%,一个中国开源模型引发的全球半导体价值重估
Kimi K3 的影响远远超出了开发者社区。
7 月 17 日——K3 发布次日——台积电(TSMC)美股 ADR 单日暴跌 6%。费城半导体指数(SOX)全周累跌 4%。SK 海力士跌 11%,Arm 跌 5%。纳斯达克综合指数下跌 1.4%。据 Business Insider 报道,SOX 已从近期高点回落 19%。Seeking Alpha 的标题是:"美国股市延续抛售,半导体全球下跌主导,Kimi K3 是导火索。"
市场的逻辑并不复杂:如果一家中国创业公司——在美国芯片出口管制下运营——能够生产出与 Anthropic 和 OpenAI 正面交锋的模型,那么当前 AI 基础设施投资的"护城河叙事"就出现了裂缝。投资者开始重新评估一个问题:为最先进 GPU 支付数百亿美元是否仍然是赢得 AI 竞赛的唯一路径?
但这恰恰是值得深思的悖论。Kimi 自己的订阅暂停恰恰证明了相反的事实:强大的模型创造的是更多的推理需求,而不是更少。暂停不是因为模型不够好,而是因为模型太好了,好到算力追不上需求。如果这只是起点,那么全球对 GPU 的总需求方向并没有改变——只是在谁拥有最聪明模型的判断标准上,加入了"谁能在客户真正涌来时撑住服务"的新维度。
此前的行业格局可以用一个数字描述:在 OpenRouter 这个开发者用来在不同模型间路由请求的开放市场上,中国模型已经占据了按周 token 用量计算的前五名(Axios 报道)。Kimi K3 的入场不是在一个空白市场插旗,而是在一个已经被中国开源模型渗透的市场上,投下了一枚当量最大的炸弹。
开源权重预计于 7 月 27 日发布。一旦模型可以被任何拥有 GPU 基础设施的机构独立部署,Moonshot 自身的订阅暂停将不再构成瓶颈——但届时竞争的维度也将从"谁能提供最好的 API"转变为"谁能在开源生态中构建最强的开发者引力"。
这不是一次售罄。这是一个信号——开源模型从"追赶叙事"进入了"同桌竞争"
在 AI 行业的集体记忆里,"模型太受欢迎以至于被迫停止收钱"从未成为一个真实存在过的问题。能力瓶颈、安全顾虑、监管压力——这些我们都见过。但需求热到把 GPU 烧穿了?Kimi K3 是第一个。
杨植麟和 Moonshot 团队做出的选择——宁可砍掉新收入也不降老用户体验——在商业上是昂贵的,在叙事上却是无价的。当一个来自北京、18 个月前还在中国市场苦苦挣扎的创业公司,在全球开发者面前做出了比硅谷巨头更体面的「算力溢出」处理方案,某种旧的座次表已经在松动。
David Sacks 的担忧不是没有道理,但他的框架漏掉了关键一点:K3 的权重将在两周后对全世界开放。届时任何人都可以下载、运行、微调它。开源的力量不在于谁造了它,而在于谁能在它的基础上建出下一个东西。从这个意义上说,Kimi K3 的订阅暂停,不是一个中国模型的胜利——而是整个开源运动的一个高水位标记。
Sources: X/Twitter (@Kimi_Moonshot, @DavidSacks, @bridgemindai, @testingcatalog), VentureBeat, BBC, Business Insider, Tom's Hardware, Seeking Alpha, Startup Fortune, Reuters, Reddit r/LocalLLaMA
本文由 AREX Agent 自动生成,仅供信息参考,不构成任何投资建议。