AREX Feed Article
Kimi K3 上线 Cursor:CursorBench 接近前沿,美国推理 + 零数据保留
7 月 27 日 21:03(UTC),Cursor 官方账号 @cursor_ai 发推宣布,Moonshot AI 的开放权重模型 Kimi K3 已上线 Cursor:称,Kimi K3 在 CursorBench 上的得分"接近前沿"(close to the frontier),并通过合作伙伴 Fireworks、Together 与 Baseten 在美国推理节点提供服务,同时支持零数据保留(Zero Data Retention,ZDR)。截至 8 月 30 日,这条推文已获得超过 100 万次浏览、9250 个赞和 178 次引用转发。
推文没有给出具体分数。评分数字在 Cursor 的上,模型规格与计费方式在 中:模型 ID 为 kimi-k3,按每百万 token 计价,输入 $3、缓存读取 $0.3、输出 $15,不收取长上下文附加费和单独的缓存写入费用,费用计入 Cursor 的"第三方其他模型"用量池。这套费率与 Moonshot 官方 Kimi API 的公开定价完全一致。
官宣内容:三家美国推理伙伴与零数据保留
Cursor 的推文原文写道:"Kimi K3 is now in Cursor! It scores close to the frontier on CursorBench. It's available on US-based inference thanks to our partners Fireworks, Together, and Baseten. Zero Data Retention is also supported."(Kimi K3 现已上线 Cursor!它在 CursorBench 上得分接近前沿。得益于合作伙伴 Fireworks、Together 和 Baseten,它在美国推理节点可用,同时支持零数据保留。)
Cursor 的模型文档在"托管"一节写明,Kimi K3 是 Moonshot AI 推出的开放权重模型,由 Cursor 通过推理合作伙伴提供,并列出规格:上下文窗口 200k,最高 1M;能力标注为"智能高、速度中、成本中"。文档同时说明,Kimi K3 在 Cursor 中可使用全部智能体工具,包括文件搜索、网页检索、执行 shell 命令和浏览器操作。
榜单名次:开放模型最高分,距头部 10 个百分点
"接近前沿"是 Cursor 的说法,实际数字要看评测页。8 月 11 日更新过的 CursorBench 榜单显示,Kimi K3 Max 得分 60.8%,在 56 个被测配置中排第 23;Kimi K3 High 为 59.7%(第 25),Kimi K3 Low 为 50.5%(第 48)。榜首是 Grok 4.6 Extra High(70.8%),Claude Opus 5 Max 以 70.0% 排在第三,与 Kimi K3 之间隔着约 10 个百分点。
在开放权重模型里,Kimi K3 是榜单上的最高分:上一代 Kimi K2.7 Code 只有 49.7%,GLM 5.2 Max 为 55.0%。Cursor 文档也写明,K3 创下了 Cursor 在开放模型中测得的最高 CursorBench 分数。若把能力和成本放在一起看,Kimi K3 High(59.7%,每任务 $1.89)与 GPT-5.6 Sol Medium(60.0%,每任务 $1.95)基本同级。
两个限定条件需要一并说明:评测页注明"结果存在波动,小分差在统计上可能没有意义";榜单在官宣之后的 7 月 30 日与 8 月 11 日更新过部分模型的定价和结果,7 月 27 日当天的榜单格局与今天并不完全可比。
Kimi K3 是谁:Moonshot 的 2.8 万亿参数开放权重模型
Kimi K3 是 Moonshot AI 的开放权重模型。微软 Foundry 官方在 7 月 28 日介绍,K3 拥有 2.8 万亿参数,"是最大的开放模型之一",原生支持 100 万 token 上下文窗口,单次请求可处理约 75 万词。Moonshot 的称其为"世界首个开放 3T 级模型",基于 Kimi Delta Attention 与 Attention Residuals 架构,并承认"整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol"。
Moonshot 发布 K3 时承诺"完整权重将在 7 月 27 日前放出",Cursor 官宣接入恰在同一天。微软博客还披露,通过 Fireworks,Kimi K3 已可部署到 Microsoft Foundry,定价为输入 $3.30、输出 $16.50、缓存输入 $0.33(每百万 token)。
伙伴捧场,社区质疑"接近前沿"的说法
官宣当晚 23:54(UTC),Fireworks 发推呼应,用"Day 0、美国托管、零数据保留"三个词概括这次合作,并艾特了 Cursor()。次日,Baseten 直接在 Cursor 推文下回复:"很高兴成为 Kimi K3 Day 0 支持的推理提供商!"()。
AI 工程师 Ofek Shaked 在中写道:"ZDR 和美国托管路径才是真正的解锁。单靠基准分接近前沿,从来过不了企业的数据政策门槛。"创业者 Cody McLain 则:"'接近前沿'这个 CursorBench 说法留了很大余地,我很好奇它在真实代码库上的表现是否和基准一致。"也有用户提醒 Cursor:"你忘了感谢 @Kimi_Moonshot"()。
上线一周后:多模态失效的论坛报告
官宣一周后,Cursor 官方论坛出现了针对 Kimi K3 多模态能力的 bug 报告。8 月 3 日,用户 belligerent_drunk 发帖称,Cursor 里的 Kimi K3"完全无法识别附带图片或截图的内容,读不出屏幕上的文字,只会根据文件名和所在目录产生幻觉",并指出"没有任何地方说明 Kimi K3 的多模态能力被禁用"()。而 Moonshot 官方博客明确称 K3 具备原生视觉能力,能"读取图片"。
用户的实测报告与 Moonshot 官方"原生视觉"宣传之间存在出入;截至 8 月 18 日,这条帖子仍在更新。榜单分数能否在真实代码库上复现、论坛报告的多模态问题是否属实,是这轮上线留下的两个待验证问题。