AREX Feed Article
SemiAnalysis 数据:AMD MI355X 新提交在 AgentX 低交互区间按每美元 TCO 击败 B300
SemiAnalysis 官方 X 账号(@SemiAnalysis_)9 月 4 日发布一条(UTC 05:23,北京时间 13:23),公布其自有基准观察:按每美元 TCO(total cost of ownership,总拥有成本)计算的总 token 吞吐,AMD MI355X 的一个新提交(submission)在 AgentX 基准(SemiAnalysis 自建的多轮编码智能体推理基准)的较低交互强度区间击败 NVIDIA B300。推文点名致谢开源推理引擎 vLLM、AMD 与 KV(键值)缓存项目 LMCache 的工程师,并附一张标注“Updated: 2026-09-04”、即发布当天更新的对比图。
图里跑的是 Kimi K3 2.8T 模型的 AgentX 回放,高亮的红绿两条曲线都标注为 vLLM 配置:绿色为 B300 (vLLM),红色为 MI355X (vLLM)。横轴是 P90(90 分位)交互强度(单位 tok/s/user,0~200),纵轴是每 1 美元 TCO 对应的总 token 数(约 200 万~2,000 万)。红色曲线从横轴左侧约 1,700 万 tokens/$ 的高位一路下滑,在中段与绿色曲线相交,交点之后 B300 反超,并把曲线延伸到约 200 tok/s/user 处。
胜出的只是曲线左侧
原帖特意圈出的限定条件是“较低交互强度区间”(lower interactivity ranges on AgentX),要读懂这个区间,先看 AgentX 怎么定义交互强度。交互强度(interactivity)指每位用户每秒获得的 token 速率;SemiAnalysis 在 8 月 24 日发布 AgentX 1.0 的中写道,每用户每秒 token 数与首 token 延迟(time to first token,TTFT)常常互相牺牲。低交互强度意味着单用户流量平缓、对单次响应快慢不敏感,服务端可以把更多会话压进同一批处理;整张曲线向右下倾斜,读作:要求的交互强度越高,每美元 TCO 能产出的总 token 越少。
图右侧的筛选面板里还列着 GB300 NVL72 (Dynamo vLLM)、GB200 NVL72 (Dynamo vLLM)、MI355X (ATOM)、H200 (vLLM) 等配置,本次只高亮 MI355X (vLLM) 与 B300 (vLLM) 两条曲线;曲线数据点旁标注着 TP8、TP8/DCP8 等服务配置标签。
便宜三成的硬件,为什么先赢在低交互端
图注给出了成本口径:按 3 年期租赁(3 Year Rental)计,B300 单卡每小时 TCO 是 3 美元,MI355X 是 2.1 美元,每小时便宜约三成;价格注明来自 SemiAnalysis 2026 年 7 月的市场定价调查与其自有 AI 云 TCO 模型。
成本差会先兑现到曲线哪一端,图表本身给了提示:低交互段延迟余量大,系统可以把吞吐往硬件极限推,小时成本更低的芯片在“每美元产出”上占便宜;到了必须给单用户保速度的高交互段,单卡绝对能力与软件调优决定上限,B300 曲线右端仍有点位,MI355X 曲线则止步更早。推文没有给出支撑这套解释的数据。
在此前的 AgentX 结果里,按美元计的领先位置属于 NVIDIA。SemiAnalysis 8 月 24 日的长文在 DeepSeek V4 Pro 一节写明:8 月 21 日之前,MI355X 的 SGLang 团队已在端到端每美元性能上追平 B200 vLLM,但 B300 vLLM 与 B200 SGLang 仍胜过 MI355X;文中还多次敦促 AMD 把其对标 TensorRT-LLM 的自研引擎 ATOM 的优化优先上游进 vLLM。同一篇里 Kimi K3 一节记录,B200 在 K3 上曾因投机解码与流水并行不兼容而被 MI355X 压制。
一个新提交,三个致谢对象
AgentX 测的不是裸芯片。写明,AgentX 衡量的是服务系统(serving system)的性能,回放负载由匿名 Claude Code 会话脱敏、重建而成,不用于评价模型质量。SemiAnalysis 在 8 月 24 日的说明中把 agent 负载描述为系统问题:长会话把 HBM(高带宽内存)的 KV 缓存容量逼到极限,需要把 KV 张量卸载到 DRAM、SSD 分层存储,路由要保前缀命中,并点名 Mooncake Store、LMCache、vLLM Simple Offloading、SGLang HiCache 等组件承担这些工作。同一份说明还称,AgentX 的基准配置“主要跟踪 recipes.vllm.ai 与 SGLang cookbook 的上游镜像”,目标是测客户实际体验到的性能,而不是特调过的镜像。
这也解释了推文致谢名单的构成——vLLM、AMD 与 LMCache 的工程师。SemiAnalysis 8 月 24 日为 AgentX 1.0 列出的致谢名单里,既有 Inferact/vLLM 的 Roger Wang、Yifan Qiao、Simon Mo、Jeff Ma,也有 AMD 上海开发中心的 Thomas Wang、Andy Luo、Seungrok Jung 等,以及 LMCache/TensorMesh 的 Samuel Shen。
被 NVIDIA 写进自家文档的第三方基准
AgentX 是 SemiAnalysis 的 InferenceX 项目自建的基准。8 月 24 日的发布说明称,AgentX 1.0 是全球首个完全开源、支持百万上下文的多轮 agentic-coding(编码智能体)推理基准,以 Apache 2.0 协议发布,数据集构建花费超过 300 万美元,完整跑分矩阵运行在超过 1,000 块芯片、约 2 MW 的持续计算上;回放流程先把 393 条内部匿名 Claude Code 会话脱敏,再按原始请求时间线重建,每种配置预热缓存后以并发扫描方式持续测量一小时,输出吞吐、TTFT 与交互强度等指标。
NVIDIA 已把 AgentX 接进自己的 AIPerf 工具:收录了一页“InferenceX AgentX MVP Benchmark”,说明其是 SemiAnalysis 在 InferenceX 框架下提出的多轮编码 agent 基准,用真实 Claude Code 会话(含 KV 缓存复用与回合间思考时间)测量推理服务器,并在运行结果上加 submission_valid 校验标记。SemiAnalysis 自己的目前列出 305 组芯片对芯片的推理比较,B300 vs MI355X 这类跨厂商 AgentX 对照单独成卡、按代际标注为 Blackwell 对 CDNA 4;页面还预告 Rubin NVL72、MI455X UALoE72 与 TPUv7/v8 即将加入。
“真实但有限”的胜利:回应与尚未公布的配置
简介自称由 vLLM 驱动的开源推理项目账号 转推称:“还有更多结果在路上。Agent 负载是系统问题,下一波提升不会只来自单一层,而会来自跨栈协同设计;当整条栈都是开放的,这是个好位置。”独立研究账号 (@Schulz_Research,简介自称做 AI 供应链中的光互连、内存与电力研究)发长文把结果称为“一场真实的胜利,也是一场有边界的胜利”:AMD 赢得的是“用户不需要快速响应、只需要廉价吞吐”的那一段,曲线再往上仍是 NVIDIA 赢;AMD 赢的方式是机时更便宜,而 B300 是更快的芯片。
认证账号 (简介自称家庭实验室工程师)回复称“AgentX 的这条通道不等于默认服务配方”,一旦离开那套投机解码与 KV 缓存配置组合,低交互段的每美元 token 优势“可能翻转”。 称“每美元 token 只在机器小时卖得出去时成立,闲置的更便宜加速卡依然是昂贵的机架”;用户 则反问“这张图有什么值得祝贺 NVIDIA 以外的人”。
这条推文没有给出该提交的具体配置与复现步骤,这项结果目前只代表 SemiAnalysis 自己的测量。SemiAnalysis 8 月 24 日的发布说明预告,三到四周内会发布一篇 AgentX 更新文章,覆盖 AMD 与 NVIDIA 的最新性能结果。
参考链接
- _