AREX Feed Article
Kimi K3 首登 LMArena 文本榜第 11 位,中国商务部正式反击"蒸馏"指控,UK AISI 发布网络安全评估
Kimi K3 在 LMArena 文本竞技场首次上榜即获第 11 位(1486±10,Preliminary),成为排名最高的开放权重模型。该成绩距榜首 Claude Fable 5(1508±6)仅差 22 分,约在 7,496,121 次投票、381 个模型的竞争中进入前 3%。由于投票量仅 3,559 次,该排名标有"Preliminary",尚待进一步验证稳定。
与此同时,英国 AI 安全研究所(UK AISI)与美国 CAISI 于 7 月 23 日联合发布 Kimi K3 网络安全初步评估。报告显示:K3 在 ExploitBench 漏洞利用基准中得分 32%,高于此前最强开放权重模型 GLM-5.2(24%),但远低于美国前沿闭源模型;在 32 步企业网络攻击模拟"The Last Ones"中,K3 平均到达第 17 步(美国前沿模型平均 28.5 步);K3 在 41 个 V8 引擎漏洞样本中未能达成任意代码执行(ACE),而美国前沿模型平均达成 20/41。UK AISI/CAISI 指出,K3 在 10 次尝试中仅 1 次完全攻破 TLO,表明其"有能力在受指示且获得初始网络访问权时,自主攻击小型、防御薄弱的企事业系统",但同时强调测试环境缺少主动防御和真实网络噪音。
7 月 27 日,中国商务部首次就美方"蒸馏"指控作出官方回应。商务部发言人通过声明指责美方搞"AI 霸权主义",称美方指控"没有任何事实依据和法律基础",并警告"对于任何实质性损害中国利益的行为,中方将采取一切必要措施坚决维护自身合法权益"。声明还反指"许多美国 AI 企业同样蒸馏了中国模型用于研发"。这一回应直接针对此前美国财长 Scott Bessent 威胁将中国 AI 公司列入实体清单的言论。
分析界对美方指控的时间线提出进一步质疑:Anthropic 的 Fable 5 因出口管制暂停后于 7 月 1 日恢复公开访问,月之暗面于 7 月 16 日即发布 K3——间隔仅 15 天。AI 研究员 Braden Hancock 对 TechCrunch 表示,"我不认为你能在 Fable 刚出来就这么短时间内、仅靠蒸馏就得到一个这么强的模型——坦率讲,时间根本不够。"月之暗面员工 Randy Xian 在 X 平台讽刺道:"对,Fable 7 月 1 日公开,K3 7 月 15 日发布。我们在短短 15 天里训练了一个全新前沿模型,吉尼斯世界纪录级别。"
截至发稿,美方未公开任何关于 K3 蒸馏 Fable 的技术证据(如日志、查询记录或训练数据签名),也未就 Nvidia GB300 芯片经泰国流入的指控提供可独立验证的材料。Bessent 所称的"美国大模型水印"同样未经公开披露。法律分析指出,蒸馏模型输出在现行美国版权法下是否构成侵权存在重大争议,而 2.4 万个欺诈账户的非法访问(Anthropic 2 月调查报告)和可能的芯片出口管制违规,是法律上更为切实的指控路径。
在社区层面,权重发布后已有开发者在双路 AMD EPYC + 1.5TB DDR4 回收服务器平台上跑出 K3 推理,搭配 GPU 卸载(如 Tesla V100)可实现 3–6 tokens/秒的解码速度。Hugging Face 讨论区出现了详细的硬件方案与成本拆解,全栈搭建成本约在 $6,000–$9,000 美元区间。社区还对 llama.cpp 进行了 AVX-512、VNNI 等指令集优化,以提升 CPU 推理效率。