AREX Feed Article
微软 Foundry 上线 DeepSeek-V4.1-Flash,Kimi K3 与 GLM-5.3-Flash 同帖新增 Global 部署
9 月 23 日,微软在 宣布,DeepSeek-V4.1-Flash 已可在 Microsoft Foundry 部署:一条渠道是 Direct from Azure,处于公共预览(public preview)阶段;另一条是 Fireworks on Foundry,已经正式可用(GA)。经 Direct from Azure 的 Global Standard 部署,定价为每百万 token 输入 0.30 美元、输出 1.20 美元;Fireworks 渠道更高,输入 0.37 美元、输出 1.50 美元。发帖人是 Microsoft Foundry Blog 的 Rashaud Savage。
模型本身不是新面孔—— 9 月 10 日就已挂上 Hugging Face,微软这次把它的托管渠道搬进了 Foundry。同一篇帖子还宣布了另外两个开放权重模型的部署扩展:GLM-5.3-Flash 经 Fireworks 新增 Global 部署选项,Kimi K3 在此前 Data Zone 部署之外新增 Global 部署。博客里的代理基准数字(比如 DeepSWE v1.1 解决 74.2% 的任务)全部是 DeepSeek 自报口径,微软在帖中注明未经独立验证。
图为微软博客帖子头图,图中数字由 DeepSeek 提供。
两条渠道、两套价格
Direct from Azure 是微软自托管的官方模型服务,计入 Azure 订阅账单,适用 Azure 服务级别协议(SLA);Fireworks on Foundry 则是把 Fireworks AI 的推理栈原生跑在 Azure 上,主打开放模型的推理优化、token 缓存、更广的预留吞吐(Provisioned Throughput)支持,以及自定义权重部署。DeepSeek-V4.1-Flash 在 Fireworks 渠道提供 PayGo Global 与 Provisioned Throughput 两种部署选项。
| 部署渠道 | 区域 | 输入 / 百万 token | 输出 / 百万 token | 缓存输入 / 百万 token |
|---|---|---|---|---|
| Direct from Azure(公共预览) | Global Standard | 0.30 美元 | 1.20 美元 | 0.006 美元 |
| Fireworks on Foundry(GA) | Standard Global | 0.37 美元 | 1.50 美元 | 0.007 美元 |
同样在 Global 区域,Fireworks 路径的输入单价比 Direct from Azure 高约 23%,输出高 25%,换到的是 Fireworks 推理栈上的缓存、吞吐和自定义权重能力。微软没有说哪条更好,只说选择取决于工作负载,建议开发者用自己应用的流量和评测数据去比较质量、延迟、吞吐、部署形态、数据要求和成本。模型发现、评测与治理仍集中在 Foundry 一处,消费路径随团队选择;入口则是模型目录里的 DeepSeek-V4.1-Flash(Direct from Azure)与 FW-DeepSeek-V4.1-Flash(Fireworks)两个条目。
新架构把全局 KV 缓存压到每 token 890 字节
博客强调 V4.1-Flash「不只是 V4-Flash 的微调版本」。它换上了因果编码器-解码器(Causal Encoder-Decoder,CED)架构:20 层因果编码器先处理输入,20 层解码器再生成输出;主干网络(backbone)共 5520 亿参数,采用混合专家(MoE)设计,预填充(prefill)阶段每 token 激活 80 亿参数,解码阶段激活 160 亿。写明了更多机制:解码器的全局 KV 缓存不再取自解码器各层自身的隐状态,而是从编码器最终隐状态投影而来;压缩稀疏注意力(Compressed Sparse Attention 2,CSA2)把每层注意力分进 Full、Reindex、Reuse 三种静态模式,并配合 FP4 格式的主 KV 缓存;预训练用了 45 万亿 token 的多模态语料,MoE 每层由 1 个共享专家加 384 个路由专家组成,每 token 激活 6 个路由专家。
这些设计指向同一个结果:DeepSeek 报告 V4.1-Flash 的全局 KV 缓存只有每 token 890 字节,约为 V4-Flash 的四分之一、DeepSeek-V1 的 1/437。博客也解释了压这一项的理由:长上下文代理应用在推理中要一直保留代码、文档、图片、工具结果和对话历史,上下文一长,推理期间维护的 KV 缓存就可能成为成本、内存和部署规模上的主要约束。微软把 DeepSeek 这张各代对比图用作了帖子头图(见上图),同时留了余地:实际延迟、并发、基础设施需求和成本,取决于应用本身、服务配置、流量形态和部署路径。
代理基准是 DeepSeek 自报,微软注明未独立验证
博客说,在 DeepSeek 公布的结果里,V4.1-Flash 在所列各项代理基准上全面超过 V4-Flash:DeepSWE v1.1 解决 74.2% 的任务,V4-Flash 为 54.4%;Terminal-Bench 2.1、CyberGym、AutomationBench 和 Agent's Last Exam 也都有提升。的对比表(最大推理力度)把数字铺得更开:Terminal-Bench 2.1 得 90.6,CyberGym 得 88.1,AutomationBench 得 54.8,Agent's Last Exam 得 31.8。
DeepSeek 的表里也有它不占先的地方:Terminal-Bench 3.0 得 30.0,低于表中的 Opus-5.0(43.3)和 GPT-5.6 Sol(34.4);ProgramBench 得 20.3,不到 Opus-5.0(37.0)的六成。微软在博客里把话说得很直接:「DeepSeek 报告的竞争对手或对比数字,未经微软独立验证」,并提醒结果会随提示、编排框架、上下文构造、部署和工作负载而变化,团队应拿自己的应用数据评估质量、延迟和成本。
图自 DeepSeek 的 Hugging Face 模型卡,数字为 DeepSeek 自报。
一个 1~100 的推理力度旋钮,替代 Flash 与 Pro 的双模型路由
V4-Flash 提供三种固定推理模式,V4.1-Flash 把它们换成一个 1~100 连续可调的推理力度(reasoning effort),每次请求单独设置:路由、分类、抽取这类任务用低力度跑,规划、编码、调试和多步工具调用再调高,中途不需要更换部署。博客的表述是:与其在「快模型」和「思考模型」之间二选一,不如跑一个部署、按请求拧力度——比起 V4 Flash 与 V4 Pro 的组合,编排简化了不少。
背景是 4 月 30 日那轮发布:微软当时把 V4 Flash(输入 0.19 美元、输出 0.51 美元)和 V4 Pro(输入 1.74 美元、输出 3.48 美元)同时带进 Foundry,建议高并发对话用 Flash、多步推理和复杂调试路由给 Pro。V4.1-Flash 0.30/1.20 的定价正好落在两者之间,一个模型加一个旋钮替代了原来的双模型搭配。微软点名的适用负载有四类:加载大型代码库、在终端里跑工具、多步迭代的仓库级编码代理;PDF、图表、截图、扫描表格这类文档密集的多模态分析,1M token 窗口让激进分块不再必要;会积累工具输出和对话历史的长时自动化或研究代理;以及靠更小 KV 缓存换取每 GPU 更多会话的高并发、成本敏感部署。
同帖扩容:GLM-5.3-Flash 与 Kimi K3 拿到 Global 选项
Kimi K3 是 的开放权重模型,共 2.8 万亿参数,微软 7 月 28 日通过 ;这次的新增,是把可用范围从原有的 Data Zone 部署扩到 Global。GLM-5.3-Flash 则经 Fireworks 拿到 Global 部署选项。
三家的来路也说得清:DeepSeek 总部在;GLM 系列来自北京的智谱,国际品牌 ;Moonshot AI 同样在北京。三家中国 AI 公司的开放权重模型家族,出现在同一篇美国云厂商的公告里,同时拿到或扩展了全球部署选项。
价格没有跟着一起公布。这篇公告只给 DeepSeek-V4.1-Flash 列了价目表,GLM-5.3-Flash 与 Kimi K3 的 Global 选项定价没有出现在帖子里——微软只留下一句:各模型的可用性、部署选项和定价不同,部署前先查 Foundry 模型目录里的模型卡。