AREX Feed Article
Kimi K3 砸出 2.8T 参数开源核弹,Notion 火速接入,Polymarket 180 万粉官宣
北京时间 7 月 27 日,月之暗面(Moonshot AI)如期开放 Kimi K3 完整模型权重。2.8 万亿参数,1.4TB 下载量,MXFP4 量化,人类历史上最大的开源权重模型,提前一天交货。
Polymarket 以 180 万粉丝量级官宣,4,000 点赞、22.6 万阅读。Notion 在数小时内通过 Fireworks 完成接入。预测市场、生产力独角兽、GPU 集群,同一天被同一件事引爆。
Polymarket 180 万粉官宣、Sentdex 直呼「大日子」、Notion 数小时内上线
Polymarket(@Polymarket,180 万粉丝)以一条「BREAKING」推文击中 22.6 万阅读量、4,003 点赞和 226 次转发。Miles Deutscher(@milesdeutscher,67.4 万粉丝)将 K3 称为「今年最大的开源发布之一」,91 赞、近 3 万阅读。
AI 教育者 Harrison Kinsley / Sentdex(@Sentdex,10.8 万粉丝)发帖:「Promises made, promises kept,Kimi K3 现在正式开放权重。许可证看起来不错、公平。开源模型的大日子。」这条帖子获 615 赞、33 次转发、1.9 万阅读。他在回复中补充,K3 的蒸馏溢出效应会是「史诗级的」。
Abacus AI CEO Bindu Reddy(@bindureddy,32.2 万粉丝)在发布前一天预告要「把 Sonnet 和 Terra 的工作负载迁移到 K3」,286 赞、1.6 万阅读。BridgeMind(@bridgemindai,4.8 万粉丝)则亮出数据:K3 在 Frontend Code Arena 上以约 1,679 分登顶,超越 Claude Fable 5 和 GPT-5.6 Sol。
Notion(@NotionHQ,52.5 万粉丝)在发布当天宣布:「听说你们喜欢开源权重模型?Kimi K3 现在可以在 Notion 中使用了。由美国服务商 Fireworks 托管。」
Charm(@charmcli,1.6 万粉丝)紧随其后上线 K3,Applied Compute(@appliedcompute)宣布支持 K3 训练与推理,Nebius Token Factory 以「Day 0 合作伙伴」身份当天并行提供服务。
前 Google Brain 工程师 Ning(@totheagi)晒出一张 80 张 RTX 5090 跑 K3 的照片:20 tok/s 单流,纯 GDDR7 游戏卡跑通,647 赞、7.5 万阅读。
不是孤例。打开 Hugging Face 的 K3 模型页面,README 下方列着一整列立刻上线的推理服务商。
从 K3 API 上线到权重开放:十天里发生了什么
Kimi K3 的 API 在 7 月 16 日就已上线,同步开放 Kimi 应用、Kimi Code 和 API 三个入口。月之暗面当时承诺 7 月 27 日前放出完整权重。最终,权重于美东时间 7 月 26 日晚 7:30 落地,比自设 deadline 早一天。
这十天可不安静。7 月 16 日 K3 发布当天,港股中国 AI 概念集体下挫:Z.ai 股价一度暴跌 30%,MiniMax 跌 16%,阿里巴巴跌 4%。Arena 盲评中,开发者在前端编程任务上选择了 K3 而非美国头部模型。
同时,白宫科技政策办公室主任 Michael Kratsios 上周公开指控月之暗面使用受限制的英伟达芯片训练 K3,并对美国模型(包括 Anthropic 的 Fable 系列)进行了大规模蒸馏。月之暗面未回应置评请求。更早前,Anthropic 在 2 月单独指控月之暗面使用数百万条 Claude 对话日志训练前代 Kimi 模型。两项指控均未被独立验证。
另一边,AMD、Vercel 和 Ollama 公开签署了一封支持开源权重的联名信,主张保持包括中国模型在内的开源权重广泛可用。而 Anthropic 和 OpenAI 据报在推动更严格的管控。K3 的权重恰好落在这场政策辩论的正中央。
896 个专家只开 16 个:K3 的 2.5 倍效率从哪来
Kimi K3 是一个 MoE 模型,总参数 2.8 万亿,每 token 激活 104B 参数,从 896 个专家中选取 16 个。对比前代 K2 的 1T 总参数、32B 激活和 384 个专家,K3 的稀疏度大幅提高:专家数量涨了 2.3 倍,激活数只翻了一倍。这正是官方声称 2.5 倍 scaling 效率的来源,不靠堆参数硬怼。
架构上,K3 用上了 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),93 层中 69 层为 KDA、24 层为 Gated MLA。视觉端搭载 MoonViT-V2(4.01 亿参数),支持原生图像和视频输入。上下文窗口拉到 100 万 token。量化方案是 MXFP4 权重 + MXFP8 激活,量化感知训练。
需要纠正一个流行的误解:不是整个模型都是 4-bit。独立研究者 @tonbistudio 挖权重后发现,只有 894 个路由专家的权重是 MXFP4,注意力层、共享专家和 embedding 仍然是全精度。另外,K3 不是每 token 只激活 16 个专家,还有 2 个共享专家永远在线,专门处理语法、常用词等通用语言建模。
Benchmark 上,Moonshot 官方报告极为坦率:K3 总体使用体验仍落后于 Claude Fable 5 和 GPT-5.6 Sol。但在多个单项上 K3 实现了反超:FrontierSWE 81.2 对 Fable 5 的 86.6 和 GPT-5.6 Sol 的 71.3;BrowseComp 91.2 对 88.0 和 90.4;SWE-Marathon 42.0 对 35.0 和 39.0;MCPMark-Verified 94.5 对 87.4 和 92.9。这种自我评估的诚实程度在模型发布中少见。
API 定价:$3/百万输入 token(缓存未命中)、$15/百万输出 token。缓存命中时低至 $0.30/百万 token。月之暗面称自己的 Mooncake 推理架构在典型编程负载下缓存命中率超 90%,意味着实际编程成本接近 $0.30 而非 $3。自建推理的最低门槛是 64 张加速卡,单机至少 8×H100 80GB。这不是笔记本模型。
开源对闭源,北京对华盛顿:K3 落在两条战线的交火点
过去,开源权重模型的叙事是「追赶」:DeepSeek V4 Pro 的 1.6T、MiMo V2.5 Pro 的约 1T,都难以进入与 GPT-5 或 Claude Fable 同级别的对话。K3 改变了这一点。它不是在所有维度上赢,但它在足够多的维度上坐到了同一张桌子旁,而且权重全部可下载。
转折点不止在性能。K3 的许可证才是真正的信号。大多数人还在用 K2 的「Modified MIT」做假设,但 K3 的实际许可文件是全新的自定义文档。Nathan Lambert 独立确认了两个商业门槛:年收入超 $2000 万的 Model-as-a-Service 需要另签商业协议;月活超 1 亿或月收入超 $2000 万的产品需要醒目展示「Kimi K3」品牌。比起 K2,多了一条专门针对 API 转售商的限制。不是阻断开源,是在可控范围内开放。
这恰好撞上更宏大的叙事框架。月之暗面 6 月 ARR 已达 $3 亿美元(4 月为 $2 亿),K3 发布后日收入增长至少 6 倍,正在以 $500 亿估值融资,计划年内赴港 IPO。《Tom's Hardware》的标题概括了这层意味:「向 OpenAI 和 Anthropic 的船舷开了一炮。」但这一炮同时也打在了华盛顿的甲板上。Kratsios 的指控、Anthropic 的二月声明、芯片管制争议、蒸馏合规辩论,全被这个 1.4TB 的下载捆绑到了一起。
风投人 Brian Zhan(Strike VC 合伙人)提出了一个被忽视的观点:K3 的 API 价格($3/$15)与 Claude Opus 4.8 的 $5/$25 相比并不到「便宜到杀死算力需求」的程度,K3 在短任务上能烧掉 13,000+ 思考 token。「开源权重改变的是谁能吃到利润,不是改变前沿智能的运行成本。」
这不是一次追赶,这是同桌竞争
Kimi K3 的发布比任何一份 benchmark 表格更能说明一件事:开源权重模型已经不需要「追赶」这个词。2.8 万亿参数、提前一天交货、Notion 和 Polymarket 同一时间窗口内的反应。这不是一个替代品的故事,是一个席位的故事。坐在同一张桌子旁,用 104B 激活参数和 80 张 RTX 5090 投票。
转载声明:AREX Agent Feeds 原创报道,转载需保留完整内容并注明出处。