AREX Feed Article
SemiAnalysis 称 MI355X 在 agentic 推理中快速缩小与 GB300 的 perf/TCO 差距,把改善归因于 SGLang、MoRI 与 UMBP
9 月 16 日上午,SemiAnalysis 在 X 上发布三帖线程,称在同口径(apples-to-apples)比较下,AMD MI355X 在 agentic 推理(多轮、带工具调用的推理负载)中的 perf/TCO(每美元性能与总拥有成本)差距「正在快速缩小」,比较对象是 NVIDIA GB300。首帖附带的 InferenceX 图表标注数据更新于 2026-09-15,两条曲线分别是 GB300 NVL72 FP4(Dynamo SGLang)和 MI355X FP4(MoRI SGLang),测试对象为 DeepSeek V4 Pro 0813 1.6T 的 agentic 场景()。
图内注明的成本参数来自 SemiAnalysis 2026 年 7 月的定价调查与 AI Cloud TCO 模型:GB300 为 2.31 美元/芯片·小时,MI355X 为 1.50 美元/芯片·小时,成本档选的是「Owning at Large Hyperscaler Volume」。线程把这次改善归因于 AMD 的 SGLang 团队、MoRI(Modular RDMA Interface)库,以及 UMBP 作为 KV 缓存卸载(KV offload)后端接入 SGLang()。这是 SemiAnalysis 自家基准平台给出的结论。
两条曲线共用一套成本口径,低 interactivity 一端仍有距离
首帖的图把两条 TCO 曲线放进同一个坐标系。在 batch 更大、interactivity 更低的一端,从图上读取,约 50 tok/s/user 处 GB300 的点位约 1.75 亿 tok/$,MI355X 约 1.25 亿 tok/$;到约 140 tok/s/user 附近两条曲线贴得很近;再往右,GB300 的数据点延伸到约 280 tok/s/user,MI355X 的曲线停在约 160 tok/s/user。
「同口径」在这里有具体条件:两边都是分解式(disaggregated)配置,跑同一个模型、同一个 agentic 场景、同样的 FP4 精度,成本也套用同一档 TCO 参数。InferenceX 的对照页上有一条注释解释了为什么必须这样比:MoRI SGLang、Dynamo TRT-LLM 这类分解式配置的每 token 成本按 decode 芯片或 prefill 芯片计算,而不是按芯片总数,与聚合式配置直接比较就不是 apples-to-apples()。
从 8 月 11 日到 9 月 15 日:MI355X 自己的三条曲线
第二帖的图只画 MI355X(MoRI SGLang):把 2026-08-11、2026-08-21、2026-09-15 三个日期测得的曲线叠在一起,成本档与 TCO 参数和首帖一致。图上两个橙色箭头标注了 5.8x 和 2.5x:纵向箭头对应相同 P90 interactivity 下每美元 token 数的变化,横向箭头对应相同 token/$ 水平下可达到的 interactivity 的变化。各数据点旁标着当时的并行配置,从 1xDPATP8+1xDPATP8 到 1xTP8+1xTP8。
被点名的三处:SGLang 团队、MoRI 库、UMBP 的 KV offload 集成
第二帖把「这些快速改善」归因于 AMD 的 SGLang 团队,以及按第一性原理设计的 MoRI 库;帖文还说,这部分改善也反映了 UMBP 作为 KV offloading 后端集成进 SGLang 的效果。图表本身的口径是每 1 美元 TCO 能买到的总 token 数,横轴固定在 P90 interactivity;按 InferenceX 对照页的定义,这里的总 token 数为输入加输出。
MoRI 出现在更早的公开结果里。2026 年 5 月 28 日,AMD 与 SGLang 团队在 LMSYS 博客上给出 MI355X 搭配 SGLang 与 MoRI 的 TCO 数据:DeepSeek-R1 分解式推理、129 tok/s/user 下每百万 token 0.169 美元,比 B200 跑 Dynamo TRT-LLM 低 5%、比 B200 跑 Dynamo SGLang 低 40%,并称这些结果由 InferenceX 验证。这些是 AMD 与 SGLang 团队自述的结果()。
UMBP 的定义来自 AMD 7 月 21 日的技术文章:Unified Memory & Bandwidth Pool,一个「调度器感知」的多级 KV 缓存,分四层:引擎 HBM、主机 DRAM、UMBP 池、SSD;它用在 MI355X 上由 Kimi K2.6、SGLang、MoRI、AITER 与 ROCm 组成的 agentic 服务栈里()。
UMBP 换掉的是什么:少一次拷贝的 HBM 到 DRAM 路径
第三帖给出机制层面的对比。按帖文说法,HiCache 位于 HBM 与外部 DRAM KV store 之间,是每个 rank 的主机侧 L2 缓冲,因此每次 load 和 offload 都要多一次拷贝;L3 到 L2 的取数没有与计算流水化;在 MLA 与 TP 下,每个 rank 会把同一份 KV 经 PCIe 复制进主机内存,而淘汰决策只依据本地信息。
UMBP 通过 SGLang 的 KVCache Store Linker 换成另一条路径:从 HBM 到 DRAM 的直接、按层流水化的写入,目标是一个共享的 per-node 池,从而去掉中间拷贝与停顿、把重复的 KV 去重,让 placement 与 eviction 可以跨 DP rank 和实例全局决定()。
AMD 在那篇 7 月的文章里给出了 TCO 层面的解释:agentic 编码的成本由 KV cache 主导,工作集一旦超出 HBM 就必须分层卸载,可用的 KV offload 被约束在每台服务器几 TB 的 CPU DRAM 之内,这部分 DDR5 成本也要计入 TCO。
同一平台的其它模型上,差距仍然很大
8 月 25 日,InferenceX 博客在一篇 GLM 5.3 的 AgentX 分析里给出了反方向的结论:在 150 tok/s/user 的 p90 interactivity 下,NVIDIA 的每 token 成本最高便宜 5 倍,「在这个工作点上,即使 AMD 芯片白送也补不上差距」。该文同时给出了两点限定:这是「一个快照,不是定论」,而且属于开源 SGLang 路径的对比,AMD 自家引擎的表现另文讨论()。
9 月 12 日,同一账号在另一条推文里给出的对比是:AMD 的 DeepSeek v4.1 Flash 镜像比 CUDA vLLM 晚两天发布,每美元性能最多比 H200 差 14.8 倍、比 B200/B300 差最多 42 倍()。
本次线程的回复里也有人按另一组配置读数据。@KennyChinaTech 引用 InferenceX 称,在 GLM5.1、30 tok/s/user 下,GB300 是 0.06 美元/百万 token,MI355X 是 0.46 美元/百万 token,并认为这不属于默认对比()。
方法学出处与一处没有答案的差距
这些数字出自 SemiAnalysis 自己的基准平台,本文未能独立复现。三帖给出的是结论、归因与机制,配置与重放方法学在 SemiAnalysis 自己的 AgentX 1.0/InferenceXv3 文章里:该文称 AgentX 1.0 是 Apache 2.0 开源的百万上下文多轮 agentic 编码基准,数据集耗资超过 300 万美元,并描述了流量轨迹重放、Pareto 前沿扫描与 warmup、确定性处理等方法()。InferenceX 首页则称仪表盘上每个数据点都由公开的 GitHub Actions 运行产出,配方在仓库里,日志与产物可查()。
回复区里也有人提出了口径层面的问题。@bytecrafter_1 问这条 TCO 是按平均吞吐算,还是按必须守住的延迟 SLO 算,并认为如果差距来自 SGLang、MoRI 与 KV offload,那它更像软件栈成熟度的快照;KV offload 会把 HBM 压力换成互连与主机带宽压力,在并发下容易先表现为 TTFT 尾部波动()。
曲线左侧仍是一个没有答案的地方:在 batch 最大、interactivity 最低的一端,GB300 的每美元 token 数仍高于 MI355X;8 月 25 日的文章说 AMD 的性能优化会在几周后的 AgentX 更新文章里出现,这一段差距是否收窄,要看那批数据。