AREX Feed Article
Kimi K3 于 AMD MI355X 单节点跑出 B200 3.8 倍吞吐,C99 引擎实现 CPU 仅 8 GB 内存推理
8 月 1–2 日,两项来自第三方的 Kimi K3 推理实验从截然相反的方向证明了同一件事:K3 的 MoE 架构对硬件的宽容度远超预期。Wafer AI 在单台 8×AMD MI355X 服务器上跑出了 B200 双节点 3.8 倍的吞吐;一位独立开发者在纯 CPU 上仅用 8.24 GB 内存就跑通了整个 2.78 万亿参数模型。
AMD MI355X:HBM 容量碾压 B200,ROCm 几乎开箱即用
旧金山推理平台 Wafer AI 于 8 月 1 日公布技术博文:K3 的完整权重加 1M token KV 缓存需超 1.5 TB 显存,连单台 8×B200(每卡 192 GB HBM)都装不下,只能跨两台服务器组 TP16。但 AMD MI355X 每卡配备 288 GB HBM3E,一台 8 卡节点即容纳完整模型,无需跨节点通信。
实测数据如下(1024 token 输入 / 400 token 输出基准):
| 配置 | 单流解码 | 峰值总吞吐 | 每美元吞吐 |
|---|---|---|---|
| 8×MI355X (TP8) | 118 tok/s | 952 tok/s | 48 tok/s/$ |
| 2×8 B200 (TP16) | 90 tok/s | 498 tok/s | 7 tok/s/$ |
| B300 (TP8+DCP8) | 172 tok/s | 1,568 tok/s | 33 tok/s/$ |
B300 绝对吞吐仍领先约 1.65 倍,但单价约为 MI355X 的 2.4 倍,性价比被反超。B200 方面,跨节点 RoCE v2 互联(~195 Gb/s)在 decode 关键路径上拖累了整体表现。
更值得关注的是软件层面:ROCm 几乎开箱即用。Wafer AI 仅修复了两个问题——sglang 中缺失的 top_k_renorm_prob 定义(一行 PyTorch 函数替代)和 AITER MLA prefill 内核的形状不匹配(将 12 个 attention head 填充至 16 再裁剪)。无需编写任何自定义 GPU 内核,与数月前 GLM5.2 在 AMD 上需要大量内核工程形成鲜明对比。Wafer AI CEO 在推文中直言"CUDA 的护城河虽未死,但这肯定砸出了一个大缺口",该推文获超 1.7 万次浏览、253 次点赞。
此前报道中 K3 的 AMD 部署已有 AMD 官方 Day-0 vLLM 支持确认,但 Wafer AI 是首个公布完整 benchmark 对比数据的第三方推理服务商,且给出的性价比结论对数据中心采购决策有直接影响。
纯 CPU 推理:176 KB 引擎、8.24 GB 内存
8 月 2 日,DevOps 工程师 Vaishnavi(@_vmlops)在 X 平台披露了一个极致实验:有人用 C99 编写推理引擎,在 2×EPYC 7763 CPU 上仅占用 8.24 GB 峰值内存跑通了整个 K3。关键原理在于 K3 的 MoE 结构——93% 的检查点是路由专家(82,432 个,MXFP4 打包),但每个 token 只激活其中 16 个,其余永远无需驻留内存。专家直接从 NVMe 流式读取并就地矩阵乘法,无需反量化步骤。
实测:最轻量预设下 8.24 GB RSS、32.69 秒/token;最快预设下 127.92 GB RSS、10.69 秒/token。引擎仅 176 KB(六个 C 文件 + libm + OpenMP),make && make test 一分钟内即可验证。
这一实验的作者坦言"不是实用的服务方式——半分钟一个 token、需要 1.7 TB 磁盘",其目标是通过实现来理解架构。但它在概念上验证了超大 MoE 模型对推理硬件的极端弹性——此前报道中 K3 在 16 张 RTX 5090 上的分布式推理已展示了消费级 GPU 的可行性,而纯 CPU 实验将这一逻辑推至极限。
本次更新来源
- (2026-08-01)
- (2026-08-01)
- (2026-08-02)
- (2026-08-02)