AREX Feed Article
Kimi K3 开源第三天,Red Hat AI 补上 Blackwell 推理的最后一块拼图
2.8 万亿参数开源了,然后呢?
7 月 27 日,Moonshot AI 把 Kimi K3 的完整权重扔上了 Hugging Face。
2.8 万亿参数,896 个 MoE 专家每次只激活 16 个,100 万 token 上下文窗口。这是开源社区见过的最大的模型权重包。上一个纪录保持者可能连它的一半都不到。
技术报告同期公开,vLLM 团队当天推送了 Day-0 支持博客。Kimi Delta Attention 用线性注意力与周期性全注意力层的交织替代了标准 Transformer 的 KV 缓存膨胀问题。LatentMoE 把 896 个专家的路由计算投影到更窄的潜在维度,降低 all-to-all 通信量和专家权重的内存带宽。Attention Residuals 引入深度维度的可学习注意力,让残差流不再是一条均匀的加和通道,而是一个加权组合网络。vLLM 博客的评价很克制但信息量足够:"这是我们处理过的最复杂的模型架构之一。"
然后社区开始算账。
公开验证的最低配置:8 张 B300 或 8 张 MI355X,只够把模型加载进显存。有意义的推理服务需要 64 张以上 GPU 塞进同一个高带宽域,因为专家路由和互联带宽会成为新的瓶颈。六位数美元的起步硬件投入,对绝大多数团队等于不可及。
Reddit 上一条高赞评论说:"Kimi K3 像一台 F1 赛车,你可以在展厅里看它,但别想开上路。"
Red Hat AI 的回应只用了一个周末。
7 月 28 日,FP8-Block 量化 checkpoint,面向 Hopper 架构的 H100/H200。FP8 是 Hopper 张量核心的原生格式,这个 checkpoint 让 H100/H200 用户在模型发布当天就能跑起来。
7 月 31 日,NVFP4 量化 checkpoint,面向 Blackwell 架构的 B200/B300。NVFP4 是 Blackwell 的原生 4 位浮点格式,这个 checkpoint 把推理效率推到了这一代硬件的理论上限。
三天。两次发布。从"能不能跑"到"在最新硬件上怎么跑得最快",答案同步落地。
从 GPQA 93.5 到 91.0,只降了 2.5 分
7 月 31 日发布的核心是一个 NVFP4 量化的 Kimi K3 checkpoint,托管在 Hugging Face 仓库 RedHatAI/Kimi-K3-NVFP4。
MoE 层权重被量化到 4 位精度,利用 NVIDIA Blackwell GPU 原生的 NVFP4 浮点格式加速推理。质量指标只用了一个:GPQA(研究生水平的科学推理基准测试)。FP8-Block 版本得分 93.5,NVFP4 版本得分 91.0。降幅只有 2.5 分,不到 3%。
@_akhaliq(51.4 万粉丝的 AI 论文传播者,曾在 HuggingFace 收购的 Gradio 团队工作)在北京时间 8 月 1 日凌晨转推了这条消息。转推本身获得 84 次点赞和 7 次转发,原始推文累计约 1 万次浏览。在 7 月 31 日这个 AI 新闻密集日(DeepSeek V4 Flash 权重公开、K-EXAONE 2.0 750B 发布、HuggingFace 自主代理网络攻击调查报告出炉),Red Hat AI 的 NVFP4 checkpoint 依然拿到了可见的传播量。
这个 checkpoint 的逻辑很清晰:它是 FP8-Block 版本的 Blackwell 对应品。FP8 是 Hopper 张量核心的原生格式,NVFP4 是 Blackwell 张量核心的原生格式。Red Hat AI 的策略是给每一代 NVIDIA GPU 架构一个对齐其硬件最优精度的 Kimi K3 量化版本。
NVFP4 为什么是 Blackwell 上的正确答案
NVFP4 是 NVIDIA 在 Blackwell 架构中引入的 4 位浮点格式。基本结构是 E2M1:1 个符号位、2 个指数位、1 个尾数位。如果只有这些,它就是又一个 4 位格式。
真正让它不同的是两层缩放机制。第一层是微块缩放:每 16 个值共享一个 E4M3 精度的缩放因子。对比 MXFP4 的 32 值块大小,NVFP4 的更小块意味着缩放因子能更局部地适应数据的动态范围,量化误差更低。第二层是张量级 FP32 标量,对整个张量做全局校准。两级缩放叠在一起,让 4 位的数值表达范围更接近真实分布。
NVIDIA 的测试数据:NVFP4 在大模型上相比 FP16 减少约 3.5 倍内存占用,相比 FP8 减少约 1.8 倍,同时关键语言建模任务的精度损失控制在 1% 以内。在 Blackwell 张量核心上,NVFP4 的推理吞吐可以达到 FP16 的 2 倍以上。
Red Hat AI 把这个格式精准地打在了 Kimi K3 最吃带宽的部分:MoE 专家层。
Kimi K3 的 LatentMoE 架构本身就是为解决专家权重的带宽问题而设计的。896 个专家的路由计算被投影到一个更窄的潜在维度,在专家计算和模型宽度之间插了一层降维。这减少了 all-to-all 通信量和每个专家被激活时需要搬运的权重数据量。但即便如此,896 个专家、每次激活 16 个、每个专家都有完整的权重矩阵,MoE 层的总参数量仍然是模型的主体。
在 LatentMoE 上再叠一层 NVFP4 量化,每条专家权重从 8 位(FP8)压缩到 4 位。推理时从显存加载专家权重的带宽需求再砍一半。对于 2.8 万亿参数这个量级的模型,带宽就是一切。
GPQA 93.5→91.0 的降幅(约 2.7%)放在 4 位量化的上下文中属于优秀水平。考虑到 Kimi K3 的规模和 MoE 架构的量化难度远高于密集模型(专家网络的不均匀激活导致某些专家的权重分布可能与全局校准不匹配),这个结果更加难得。Red Hat AI 显然在量化校准流程上做了针对性的工程工作,而不是简单套用通用量化配方。
推理引擎方面,checkpoint 通过 vLLM 的 compressed-tensors 格式发布。compressed-tensors 是 vLLM 项目维护的开放量化格式标准,不与任何专有工具链绑定。checkpoint 与 vLLM 的 NVFP4 后端直接对接:用户加载模型时,vLLM 自动识别 compressed-tensors 格式并调用对应的 NVFP4 内核路径。
vLLM 团队在 Day-0 支持博客中确认,Blackwell GPU 上的 NVFP4 推理路径已经打通。配合 Inferact 开源训练的 DSpark 投机解码模型,单用户可在 16×GB300 NVL72 配置下达到 370 tok/s 的解码速度。对比无投机解码的 118 tok/s,提升了 3.14 倍。低熵任务(如代码生成)的平均接受率约为 4.73 个 draft token 每步,高熵任务(如创意写作)约为 2.61 个。
用户不需要自己跑量化校准流程。下载 checkpoint,配置 vLLM,一行命令启动。
三天两个 checkpoint,管线化的推理引擎团队
Red Hat AI 是红帽公司的 AI 部门。红帽在 2019 年被 IBM 以 340 亿美元收购,至今仍是企业级开源软件的最大玩家。Red Hat AI 的定位是"用开放平台和社区加速 AI 创新",Twitter 简介只有一句话:"The future of AI is open."
这个团队的核心资产是与 vLLM 项目的一体化关系。vLLM 是当前开源社区最主流的 LLM 推理引擎,GitHub 星标超过 50k,NVIDIA、AMD、AWS 都在用它做推理部署。Red Hat AI 的工程师是 vLLM 的核心维护者和贡献者:Michael Goin(vLLM 维护者之一,负责核心调度和量化支持)和 Cedric Clyburn(Red Hat 高级开发者布道师,2026 年 6 月在 DeepLearning.AI 开设了 vLLM 推理课程)。红帽 CTO Chris Wright 多次在公开场合将 vLLM 定位为 Red Hat AI 推理策略的基石。
这一周的发布节奏摊开后,能看到一条正在加速的管线:
- 7 月 27 日:Kimi K3 权重公开。Red Hat AI 发推确认模型以 MXFP4 权重和 MXFP8 激活的 compressed-tensors 格式发布,"比 FP16 减少约 4 倍内存带宽"。Day-0 预览镜像已就绪,声称"权重落地的那一刻你就可以开始实验"。
- 7 月 28 日:FP8-Block checkpoint 发布,面向 H100/H200。vLLM 官方账号转发评价:"FP8 是 Hopper 张量核心的原生格式,所以他们的 FP8-Block 让模型跑在了这些 GPU 设计输出的吞吐量上。很高兴看到 Red Hat AI 这么快就补上了格式的缺口。"同日,Red Hat AI 宣布 Kimi K3 已在一台 8×B300 节点上完成推理服务部署。
- 7 月 29 日:Speculators 库支持并行起草(parallel drafting)。P-EAGLE、DFlash、DSpark 三种算法能一次预测一个 token 块的多个候选,消除了序列依赖。配合 Qwen3-30B-A3B 的 DFlash 编码任务演示,比标准自回归起草有显著增益。
- 7 月 31 日:NVFP4 checkpoint 发布。同时 Speculators v0.7.0 上线,新增 DSpark 支持,附带 GLM-5.2 和 Gemma 4 31B 的 DSpark 投机模型。新版本还引入了 config-file-first 的训练 CLI、Muon 作为默认优化器,以及约 3 倍更快的 DFlash 训练速度。
还有一个容易被忽略的横向动作:Red Hat 在 7 月 27 日加入了 NVIDIA 的 Open Secure AI Alliance,红帽 CTO Chris Wright 亲自转发。这个联盟以"安全、透明、开放工具"为口号,成员包括多家企业级 AI 公司。
从模型权重落地到覆盖两代 GPU 架构的最优量化方案,Red Hat AI 用了四天。这个速度的背后不是加班,是 compressed-tensors 格式的标准化、vLLM 后端对 NVFP4 和 FP8 的模块化支持,以及团队此前在 Qwen3.5-397B、GLM-5.1 等模型上反复打磨过的量化管线。
NVIDIA 也在做,但开源推理栈有自己的逻辑
把 Kimi K3 跑在 Blackwell 上不是 Red Hat AI 独占的赛道。
NVIDIA 的 Dynamo 推理框架提供了 Kimi K3 的官方部署配方,支持 vLLM 后端,面向 GB300 NVL72 等顶级企业配置。Dynamo 的优势是硬件-软件协同优化:NVIDIA 自己调内核,精度和吞吐可以做到最极致。
Unsloth 走的是消费级路线。团队发布了 Kimi K3 的 GGUF 量化方案,NVFP4 版本可在 2×RTX PRO 6000 Blackwell 上跑到 127.7 tok/s(单用户、上下文长度 1)。Unsloth 的定位是让个人开发者和研究者也能在桌面级硬件上碰一碰这个 2.8 万亿参数的模型,哪怕只是推理。
SGLang 是另一个推理框架选项,也实现了 Kimi K3 原生支持。团队的宣传素材是"两周内让 NVFP4 agentic 工作负载跑到 500 TPS",强调 agent 场景下的高吞吐。
Red Hat AI 的差异化不在某个单点性能数字上。在那个维度,NVIDIA 永远是天花板。Red Hat AI 的牌在三个维度:
企业级交付。Red Hat AI Inference Server 把 vLLM 的推理能力打包成企业产品,通过 OpenShift AI 平台以模型即服务(MaaS)的方式提供。7 月 30 日发布的 OpenShift AI 3.4 技术预览还引入了 LLM-D 流控,一个优先级队列和公平性策略,能在 GPU 饱和时将关键请求的首 token 延迟降低约 90%。"两个团队共享同一个模型,一个跑批量摘要,一个跑实时编码聊天。批量任务饱和了 GPU,聊天机器人的首 token 延迟飙升。流控在不改任何应用代码的情况下修复了这个问题。"
平台中立。与 Dynamo 绑定 NVIDIA 生态、Unsloth 主要覆盖消费级 NVIDIA GPU 不同,Red Hat AI 的方案同时支持 NVIDIA(Hopper 和 Blackwell)和 AMD(MI355X)。Kimi K3 的 vLLM Day-0 支持博客将两种硬件列在同一页面。在 NVIDIA 垄断高端推理硬件的当下,这个选择本身就带有立场。
开源格式标准化。compressed-tensors 是 vLLM 项目维护的开放格式,不与任何厂商的工具链绑定。Red Hat AI 的所有量化 checkpoint 均以此格式发布,任何运行 vLLM 的环境都能直接加载。对比某些厂商的专有量化格式只能在自家的推理框架里使用,这是一个架构层面的区别。
三个维度叠加在一起,Red Hat AI 的定位逐渐清晰:不是做最快的推理引擎,是做最通用的推理基础设施层。
开源模型的终点不是 Hugging Face
Kimi K3 的发布引发过一轮讨论:2.8 万亿参数的权重文件放在那里,不等于有人能用。"开源权重"和"可用的开源模型"之间的差距,需要一整套推理基础设施来填。
Red Hat AI 这一周的连续发布,是填这个差距的一次演示。
FP8-Block 让全球数万张 H100/H200 的用户在模型发布当天就能跑实验。NVFP4 让已经拿到 Blackwell 硬件的团队(无论是云上的 B200/B300 实例还是本地的 RTX PRO 6000)把推理成本再砍一刀。两步之间只隔了三天。上一个 checkpoint 的社区反馈还没消化完,下一个已经上线。
这个节奏不是偶然的。Red Hat AI 的推理栈不是从 Kimi K3 才开始搭的。compressed-tensors 格式、vLLM 的 NVFP4 后端、Speculators 投机解码、LLM-D 流控。这些组件在此之前已经经过 Qwen、GLM、Gemma 等多轮模型的打磨。Kimi K3 只是第一个把所有组件同时调用起来的巨型模型。
Red Hat AI 不是唯一在做这件事的团队,但它目前动作最快、覆盖面最全。从 Hopper 到 Blackwell,从 NVIDIA 到 AMD,从投机解码到 GPU 流控,这条推理栈在以周为单位生长。Kimi K3 是第一个被完整覆盖的 2 万亿级模型。
下一个是谁,取决于下一个开源权重发布时,谁能在三天内交出第一个 checkpoint。
参考链接
- Red Hat AI 原推:
- _akhaliq 转推:
- NVFP4 checkpoint:
- FP8-Block checkpoint:
- vLLM 博客「Kimi K3 Is Here」:
- NVIDIA NVFP4 技术博客:
- Kimi K3 技术报告: