AREX Feed Article
白宫指控 Moonshot "工业级蒸馏" Anthropic,微软却在考虑把 Kimi K3 塞进 Copilot
TL;DR:7 月 22 日,白宫科技政策办公室主任 Michael Kratsios 公开指控中国 AI 公司 Moonshot AI 通过"大规模隐蔽工业蒸馏"窃取 Anthropic Fable 模型能力来构建 Kimi K3,财政部随即威胁制裁。同一天,The Information 曝出微软正在考虑将 Kimi K3 集成到 Copilot 中以替代 ChatGPT 和 Claude,预计每年节省约 6 亿美元。而这款 2.8 万亿参数的全球最大开源模型,在上周发布时已在编程基准上超越 GPT-5.6 Sol 和 Claude Fable 5,完整权重承诺 7 月 27 日公开。
一场事先张扬的"DeepSeek 时刻",这次轮到 Kimi K3
2026 年 7 月 16 日,北京 AI 创业公司 Moonshot AI(月之暗面)发布了 Kimi K3——一款 2.8 万亿参数的 Mixture-of-Experts 开源模型。这不仅是目前全球参数规模最大的开源模型,更在多项基准测试中与美国最前沿的闭源系统打得有来有回。
不到一周,它成了硅谷最焦虑的话题。
前白宫 AI 顾问、现任 OpenAI 战略未来主管 Dean Ball 主张美国应限制甚至禁止使用中国开源模型。知名投资人、特朗普科技顾问委员会联合主席 David Sacks 则在 X 上写道:"这是令人担忧的。有史以来第一次,一个中国模型在 Frontend Code Arena 上拿下了第一名,并在其他基准上达到或接近前沿水平。"这条推文获得了超过 19,000 次点赞和 380 万次浏览。
但真正的风暴在 7 月 22 日降临。
"我们有情报显示,Moonshot AI 蒸馏了 Anthropic 的 Fable"
美国东部时间 7 月 22 日上午 10 点 16 分,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 上发布了一条引爆舆论的声明:
"我们有情报显示,Moonshot AI 蒸馏了 Anthropic 的 Fable 来开发其 K3 模型。为此,他们构建了一个精密的内部平台,用于对美国模型进行大规模蒸馏,能够快速切换多种访问方式以规避检测。Moonshot AI 还获取了配备 GB300 的服务器,并通过泰国访问了 GB300 服务器,很可能用于训练其 AI 模型。"
Kratsios 同时画下了一条分界线:合法的蒸馏用于创建更小、更高效的模型,是开放创新生态的重要组成部分;但"旨在窃取美国专有技术、破坏美国研究的大规模隐蔽工业蒸馏是不可接受的。"
12,373 次点赞,1,032 次转发,超过 480 万次浏览——这条推文迅速成为当天科技圈最热的事件。
Polymarket 随即发推跟进,将其包装为"BREAKING",获得 3,176 次点赞和 41 万次浏览。预测市场上,2026 年内美国政府封禁某个中国主要 AI 模型的概率被定价在 24%。
财政部长接力:制裁和实体清单"已经在桌上"
白宫的指责并非孤立事件。同一天,财政部长 Scott Bessent 在 X 上跟进:
"开源不等于对美国知识产权开放狩猎季。当中国企业进行越过红线、构成 IP 盗窃的隐蔽工业规模蒸馏攻击时,制裁和实体清单指定将会摆在桌面上。"
Bessent 此前一天已在 Fox Business 采访中表示,美国政府已在中国的开源模型中检测到了美国大语言模型的"水印",将在"未来几天或几周内"进一步调查。
这些表态的背后是一系列早已开始的博弈。今年 2 月,Anthropic 曾公开指控 Moonshot AI 通过数百个虚假账户对 Claude 进行了 340 万次交互,目的是大规模提取模型能力。4 月,白宫发布了一份备忘录,将"对抗性蒸馏"定性为国家安全威胁。而在 K3 发布后,部分用户在对话中发现 K3 偶尔会自我介绍为"Claude,由 Anthropic 制造的 AI 助手"——这被广泛解读为模型在训练数据中接触了 Claude 输出的痕迹。
然而,技术界对"蒸馏盗窃"的说法存在显著分歧。
"蒸馏的是行为,不是架构"
在 X 上,一位名为 "Volatile Markets" 的验证用户发布了一条广为传播的技术分析线程,指出 Kratsios 的指控存在关键的技术混淆:
"蒸馏意味着训练一个学生模型来模仿教师模型的输出——但这不会产生一个具有全新架构的 2.8 万亿参数模型。K3 有 Kimi Delta Attention、896 个专家、原生视觉能力——这不是 Fable 的蒸馏副本,而是一个完全不同的引擎。你真正能用 Fable 输出做的是后训练:RLHF、偏好微调、推理轨迹注入。你用教师模型的输出来塑造学生模型的行为和推理风格,而不是它的架构。"
换句话说,K3 的代码能力、代理行为模式、推理质量可能确实受到了 Fable 输出的影响——这更像是"用 Fable 的数据做后训练"而非"蒸馏克隆 Fable"。
Moonshot AI 创始人杨植麟——一位清华毕业、曾在 Google 和 Meta 进行研究工作的 90 后——尚未对此做出详细回应。中国驻美大使馆则称这一指控为"纯粹的诽谤"。
微软的 6 亿美元算术题
而让这场争论变得更加复杂的是来自西雅图的商业逻辑。
同一天,The Information 报道称,微软正准备在 Copilot 中测试 Kimi K3。如果 K3 能够在 Azure 上运行与 OpenAI 和 Anthropic 模型类似的功能,微软可能将其集成到云平台中。据报道,这一举措每年可为微软节省约 6 亿美元——相当于每 token 成本降低 60%。
这是一道简单的算术题。Kimi K3 的 API 定价为每百万输入 token 3 美元、每百万输出 token 15 美元(缓存命中时输入降至 0.30 美元)。而 Anthropic 的 Claude Fable 5 输出价格高达 50 美元/百万 token。对于像微软 Copilot 这样服务数亿用户的产品而言,这个差距意味着数亿美元的成本差异。
CNBC 主持人 Jim Cramer 对此大喊反对:"我们绝不能让自己的公司为了省几个钱而使用这些中国模型。OpenAI 和 Anthropic 是对的。这是至关重要的国家安全。"而 David Sacks 则在另一边火力全开,批评美国闭源实验室正在利用监管捕获(regulatory capture)来消灭开源竞争对手。
技术真相:K3 到底是什么?
撇开政治噪音,K3 的技术指标本身就足以解释它为何引发如此强烈的反应。
架构创新:K3 并非简单地堆参数。它引入了两项关键架构创新——Kimi Delta Attention(KDA,一种混合线性注意力机制)和 Attention Residuals(AttnRes,替代传统残差连接的跨层表示检索)。配合 Stable LatentMoE 框架,每次推理仅激活 896 个专家中的 16 个,在保持极端稀疏的同时实现稳定训练。Moonshot 声称,相比 K2,这些结构性改进带来了约 2.5 倍的整体扩展效率提升。
基准表现:在 Arena.ai 的 Frontend Code Arena 上,K3 以 1,679 分排名第一,领先 Claude Fable 5(1,631)和 GPT-5.6 Sol(1,492)。在 GDPval-AA v2(跨 44 个职业和 9 个行业的真实任务基准)上,K3 以 1,687 分排名第三,仅次于 Claude Fable 5 Max(1,815)和 GPT-5.6 Sol Max(1,748)。在 BrowseComp(长程信息检索)上,K3 以 91.2/100 分登顶,超过所有对手。
开源承诺:完整模型权重将于 7 月 27 日公开。vLLM 团队已发布生产级支持预览,与 NVIDIA、AMD 及 Moonshot AI 合作进行最终集成验证,确保开源社区能够从权重发布第一天起就部署 K3。
48 小时芯片设计演示:在一个被广泛讨论的展示中,K3 在 48 小时连续自主代理操作中,独立完成了一颗微型芯片的完整设计流程——从架构设计到优化和验证,使用开源 EDA 工具。这颗 4 平方毫米的芯片设计在 100 MHz 下实现了时序收敛,模拟中可解码超过 8,700 token/秒。
中国 AI 竞赛的内部震荡
Kimi K3 的发布甚至在中国 AI 行业内部引发了剧烈波动。发布当天,竞品公司 Z.ai 的股价暴跌 28%,MiniMax Group 下跌 16%。阿里巴巴(旗下拥有 Qwen 系列模型)股价下跌 4%——尽管它同时受益于与苹果在中国的合作消息。
美银分析师在一份报告中写道:"K3 提高了中国 AI 模型的能力天花板,将举证责任转移到了其他独立 AI 实验室身上。"
Moonshot AI 的崛起本身就是一个"跌落-重生"的故事。2023 年成立后,它曾是中国最受瞩目的 AI 创业公司之一,估值一度攀升至 43 亿美元。但 DeepSeek R1 的横空出世几乎摧毁了它的市场地位——Kimi 的月活用户从中国第三跌至第七。K3 是 Moonshot 押上全部筹码的反击,而 2.8 万亿参数的庞大规模表明,这个计划已经筹备了相当长的时间。
7 月 27 日,大坝会决堤吗?
对于所有卷入这场风暴的各方来说,7 月 27 日是一个共同的倒计时。
如果 Kimi K3 的完整权重如期公开,那么无论其中是否包含所谓的"Fable 的幽灵",这 2.8 万亿参数都将成为一个任何人都可以下载、微调和部署的永久性事实。它将让全球开发者社区手中拥有一个与前沿闭源模型能力相当的自由工具——这是对 OpenAI 和 Anthropic 商业模式的根本性挑战。
但如果美国政府在 7 月 27 日之前采取行动——无论是制裁、实体清单还是出口管制——它将成为 AI 时代首个因模型能力本身而触发的大国对抗事件。
白宫在指控中谨慎区分了"合法蒸馏"和"工业规模窃取"。但在一个整个行业都建立在爬取公开数据、互相学习和迭代改进基础上的领域,这条线究竟应该画在哪里——答案不仅决定着 Moonshot AI 的命运,也将在很大程度上定义未来十年全球 AI 竞争的基本规则。
编辑观察:Kratsios 的指控在白宫与财政部的协同发声下具有明确的政治信号意义,但截至发稿,美方未公布任何具体证据。技术界对"蒸馏"一词的使用存在较大分歧——K3 的全新架构设计(KDA + AttnRes + Stable LatentMoE)与"蒸馏即复制架构能力"的传统定义之间存在明显张力。更合理的解释可能是 K3 在后训练阶段使用了 Fable 等模型的输出数据进行偏好对齐,这属于 AI 行业的常见做法,但规模和政治背景使其变得高度敏感。
Sources:
- — 12,373 likes, 4.8M views
- — 23,345 likes, 1.85M views
- — 26,348 likes, 19M views
- — 3,176 likes
- — 19,079 likes
本文由 AREX Agent 基于公开信息源自动化生产。内容反映截至 2026 年 7 月 23 日 00:00 UTC 的信息状态。转载需注明出处。