AREX Feed Article
Kimi K3 上线 Amazon Bedrock:AWS 模型卡确认 1M token 上下文、原生视觉与提示缓存规格
北京时间 2026 年 9 月 22 日 11 时 51 分,Moonshot AI 的 Kimi 官方账号 在 X 上宣布,Kimi K3 已在 Amazon Bedrock 上可用,面向编码、文档分析与扩展智能体(agent)工作流三类场景,并支持显式提示缓存(explicit prompt caching)。公告称,企业可以在 Bedrock 的访问、加密与审计控制之下运行这些工作流;推文的外链直接指向 。
这张模型卡由 Amazon Web Services 发布,独立于 Moonshot,截至发稿可以正常访问。卡内写明:Kimi K3 是 Moonshot AI 最强的开放权重(open-weight)模型,具备原生视觉与 1M token 上下文窗口,模型发布日期为 2026 年 9 月 18 日、生命周期状态为 Active,程序化访问的模型 ID 为 moonshotai.kimi-k3。模型卡未附任何独立基准数据,文中的能力与性能表述均为 Moonshot 与 AWS 双方口径。
公告与模型卡互相指向,可用性由两份材料共同印证
K3 模型本体按模型卡口径已于 9 月 18 日发布;这条距发布日 4 天的公告,新增的是 Bedrock 这一企业分发渠道。公告与文档互相指向:推文的外链正是这张模型卡的地址。
公告点名的三类场景与提示缓存特性,都能在模型卡中找到对应章节:能力矩阵、提示缓存规格表与调用方式说明。
模型卡规格:图像进、文本出,四种 API 只走 bedrock-runtime
能力矩阵显示,K3 接受文本与图像两种输入,输出仅支持文本——音频、语音、视频、向量嵌入(embedding)与图像输出均不在支持范围。调用方面,Responses、Chat Completions、Converse、Invoke 四种 API 均经 bedrock-runtime 端点提供,bedrock-mantle 端点不支持;AWS 在卡内建议新应用尽量使用 bedrock-runtime,并针对 K3 推荐 Chat Completions API。
区域上,模型卡说明 K3 通过两条跨区域推理通道提供:US Geo(us.moonshotai.kimi-k3,请求只在美区地域内的区域之间路由,以遵守美国数据驻留要求)与 Global(global.moonshotai.kimi-k3,可路由至全球受支持的商业区域)。区域表中,弗吉尼亚北部、俄亥俄、加州北部、俄勒冈四个美国区域和加拿大中部同时标注支持 Geo 与 Global;卡内列出的卡尔加里、法兰克福、苏黎世、斯德哥尔摩等区域仅有 Global 通道。
服务层级方面,标准档之外 K3 支持 Priority(按标准档每百万 token 价格的 1.75 倍计费)与 Flex(0.5 倍),Reserved 不支持;模型卡注明,目前只有 Responses 与 Chat Completions 两种 API 支持服务层级。
提示缓存:1,024 token 起存,缓存读取价为输入价的一成
提示缓存是本次公告点名的特性。模型卡规格表写明:K3 支持显式提示缓存,每个缓存检查点最少 1,024 token,缓存保留时间(TTL)不低于 30 分钟。卡内同时注明,K3 默认支持隐式(自动)提示缓存,而显式配置缓存控制可以提高缓存命中率、从而降低延迟与成本,因此 AWS 建议使用显式提示缓存;显式缓存目前只在 Responses 与 Chat Completions 两种 API 上可用。
价格按每百万 token 计(Standard 档):Global CRIS(跨区域推理)输入 3.00 美元、输出 15.00 美元、缓存读取 0.30 美元、缓存写入(30 分钟)3.75 美元;US CRIS 四项分别为 3.30 美元、16.50 美元、0.33 美元与 4.125 美元。读一次缓存的价格是标准输入价的一成,写入则贵四分之一。
K3 本体:2.8T 参数开放权重模型,厂商自认整体性能仍落后最强专有模型
Moonshot 在 中称,K3 是一个 2.8T 参数模型,基于 Kimi Delta Attention 与 Attention Residuals 构建,带原生视觉与 1M token 上下文窗口,并称其为「全球首个开放 3T 级(3T-class)模型」。博客同时承认,K3 的整体性能仍落后于最强的专有模型——Claude Fable 5 与 GPT 5.6 Sol——但表示 K3 在 Moonshot 自己的评测套件中表现出前沿级性能、持续优于其他受测模型。博客称,K3 已在 Kimi.ai、Kimi Work、Kimi Code 与 Kimi API 上可用。
模型卡对 K3 场景的写法与厂商口径一致:面向跨大型代码库、文档与图像维持上下文的长程编码与知识工作;卡内的许可条款链接指向 Hugging Face 上的 moonshotai/Kimi-K3 仓库。
官方基准图:知识工作三项居首,编码并非全面领先
技术博客内嵌的评测图表全部标注「思考力度均已拉满(max 或 xhigh)」。在名为 Internal Knowledge Work Bench(内部知识工作基准)的图表中,K3 于 Online Exp Bench 得 75.5 分,高于 GPT 5.5 的 70.6 与 Claude Opus 4.8 的 65.9;DECK-Bench(73.5 对 68.2、66.9)与 Finance-Bench(62.6 对 60.7、58.4)同样居首。
编码一项的领先面更窄:K3 在 Program Bench(77.8 对 GPT-5.6 Sol 的 77.6)与 SWE Marathon(42.0)居首,但 Terminal Bench 2.1 的 88.3 低于 GPT-5.6 Sol 的 88.8,FrontierSWE 的 81.2 落后于 Claude Fable 5 的 86.6。智能体图表里,K3 在 BrowseComp 以 91.2 领先 GPT-5.6 Sol 的 90.4,在 SpreadsheetBench 2(34.8 对 34.7)与 Automation Bench(30.8)居首;GDPval-AA v2 Elo 的 1,668 则落后于 Claude Fable 5 的 1,760 与 GPT-5.6 Sol 的 1,748。
博客注明,图表中 Claude Fable 5、Claude Opus 4.8、GPT 5.6 Sol 与 GPT 5.5 的成绩引用自 Anthropic 与 OpenAI 的官方页面,GDPval-AA 等智能体成绩引用自 Artificial Analysis;K3 自身的数字为 Moonshot 自报。图表脚注还写明,Fable 5 的成绩可能带有回退机制(fallback),GPT-5.6 Sol 的成绩包含潜在的安全护栏机制(cyberguards)。AWS 模型卡没有复述其中任何一项。
成本散点图:max 档得分略低一档,成本不到 Fable 5 的一半
博客中的「Kimi Code Bench V2 · Score vs Cost per Task」散点图给出了成本位置:K3 在 max 思考档得分约 72.5%,单任务成本不到 4 美元;Claude Fable 5(max)得分约 77%,成本超过 10 美元;Claude Opus 4.8(max)约 71.5%、6 美元出头;GLM-5.2(max)约 64.5%,成本约 1.5 美元。按这张图,K3 的位置是用略低一档的得分换取一半以上的成本节省。
至于模型卡上「Moonshot 最强的开放权重模型」这一定位,卡内「模型开发与性能」处给出的入口,指向的仍是 Hugging Face 上 Moonshot 自己的模型/服务卡。