AREX Feed Article
SemiAnalysis 公布 Ironwood 第三方推理基准:性能/美元最高领先 B200/B300 50%
AI 基础设施研究与咨询机构 SemiAnalysis 于 9 月 7 日发布付费报告《TPU Inference Externalization Full Steam Ahead》,公开了 Google TPUv7 Ironwood 的第一批第三方推理基准:在与 NVIDIA B200/B300 的同口径对比中,Ironwood 的性能/美元最高领先 50%。报告在 Substack 上线于 UTC 时间 9 月 7 日 20:00(北京时间 9 月 8 日凌晨 4 时),SemiAnalysis 官方 引介,指向。
摘要帖把报告主题概括为「TPU 推理外部化全速推进」:InferenceX、TPU 软件栈快速外部化、客户群扩大、Ironwood 与 TPUv8i、CUDA 护城河收窄。报告同时给出软件侧的时间表——支撑 vLLM/SGLang 的 TorchTPU 外部栈预计 10 月前后结束私有测试并开源,Google 之后计划把支持扩展到 Kimi K3、GLM5.3 等开放权重模型。报告页面标注为付费内容,上述数字均为 SemiAnalysis 的独立测试与分析口径,部分基于其自建的总拥有成本(TCO)模型假设。
Ironwood 的性价比优势来自每小时成本
基准的设定是:开放权重模型 Qwen3.5 397B、FP8 精度、聚合式(aggregated)推理服务与单 token 预测,上下文为 8k1k。成本对比采用「外部 TCO」口径——即假设一个超大规模实验室直接购买 TPU,与购买 B200/B300 的持有成本对比。报告图表标注的小时成本假设为:TPU 每芯片 1.21 美元、B200 每 GPU 1.73 美元、B300 每 GPU 2.26 美元。
在每用户每秒 100 token 的交互度(interactivity)下,Ironwood 每百万总 token 成本约 0.181 美元,B200 约 0.222 美元、B300 约 0.276 美元,分别低约 19% 和 34%,而每用户生成速度相同。报告承认,多数原始性能点上 TPU 并不领先 NVIDIA;买家关心的是每美元和每瓦的产出。
在每用户每秒 20 token 的测试点上,Ironwood 的原始吞吐反超:每芯片每秒约 9,364 个总 token,B200 为 8,903、B300 为 8,925,高约 5%。叠加更低的小时成本后,每美元 token 数比 B200 高 50.4%、比 B300 高 96.0%。报告特意注明,50%~96% 这一优势只对应该测试点,并非每个延迟目标都成立。
换成 Google 内部成本口径(1.03 美元/芯片小时),并发数 256 时每美元性能优势扩大到比 B200 高 76.7%、比 B300 高 130.2%,代价是平均首 token 延迟(TTFT)5.41 秒,B200 为 3.75 秒、B300 为 2.40 秒。
沿端到端延迟的帕累托(Pareto)曲线看,TPU 的成本优势覆盖大部分区间:中位响应时间 20 秒处,每百万总 token 成本约 0.098 美元,B200 约 0.106 美元、B300 约 0.132 美元,低约 8% 和 25%;中位响应时间约 30 秒附近,B200 还能反超一小段,更长的响应时间下 TPU 重新占优。
把 TPU 变成原生 PyTorch 设备
这些负载要真正落到外部客户手里,瓶颈在软件栈。报告梳理了 vLLM 对 TPU 支持的三段演进:最初的 TPU 原型基于 PyTorch/XLA,靠惰性执行把算子攒成计算图交给 XLA 编译;当前公共后端 tpu-inference 在有现成 JAX 实现时直接用 JAX,否则由 TorchAX 把 PyTorch 模型翻译成 JAX 执行。
第三段即 TorchTPU:vLLM 和 SGLang 把 TPU 当作原生 PyTorch 设备,StableHLO、XLA 和 TPU 优化的 Pallas 内核在底层负责执行。报告称,前述基准正是用「即将到来的原生 TorchTPU vLLM 栈」跑出来的。
该栈目前仍在私有测试阶段,Google 以 FP8 的 Qwen3.5 397B 作为初始适配(bring-up)模型,之后计划把支持扩展到 Kimi K3、GLM5.3 等模型。报告给出的逻辑是:今天 vLLM 和 SGLang 把模型发布当天(day-0)的支持集中在 NVIDIA,对 AMD 覆盖一般;一旦少数模型优化到位,为大量流行开源模型提供近 day-0 支持会容易得多,TorchTPU 稳定后维护者有可能把 TPU 加进 day-0 名单。
SemiAnalysis 还给出了它对两家公司软件能力的判断:AMD「还在学习如何建立 test-first 的软件文化」,而 Google 有数十年软件工程经验和成熟的质量文化,因此外部 TPU 软件会快速成熟。它同时列出后续要补的功课——投机解码(speculative decoding)、拆分式 prefill、KV cache offload(KV 缓存卸载)、多轮智能体(agentic)负载——并预告年内会发布 agentic 场景的测试结果。报告致谢部分提到,SGLang 侧的 TorchTPU 适配还有 RadixArk 团队参与。
FP4 与拆分式服务:Ironwood 尚未补齐的两块
精度档位是第一个缺口。NVIDIA 用 FP4 跑模型相比 FP8 有质量损失,所以同口径对比都跑在 FP8 上;而 TPUv7 没有原生 FP4 计算,因此在 FP4 场景 NVIDIA 仍保持领先。报告判断,这个差距要等原生 FP4 的 TPUv8i——它相信 TPUv8i(代号 Boardfly)届时将能与 NVIDIA Rubin NVL72 竞争。
第二个缺口是拆分式服务(disaggregated serving,把 prefill 预填充与 decode 逐 token 生成拆到不同实例执行)。Google 内部已用多年、路径高度优化,但外部 TPU 服务栈还没有完全优化的 disagg 路径。因此在「拆分对拆分」的比较中,GB200/300 NVL72 目前每美元性能更划算;报告预计几个月内差距就会收窄。它给出的「苹果对橘子」数据是:拿聚合式 TPUv7 对比 GB300 NVL72 的 disagg,在中间段端到端延迟上,GB300 每美元性能仍有约 30% 的优势。
规模条件则站在 Google 一侧:TPUv7 pod 可通过低延迟 ICI(Inter-Chip Interconnect,芯片间互联)扩展到 1,000 多颗芯片,报告称这为大模型 disagg 和超宽专家并行(expert parallelism)提供了 NVL72 做不到的优化空间。
从 Anthropic 的百万颗订单说起
这批基准的意义在于它是「第三方」测的。Ironwood(TPUv7)是 Google 第一代可以让外部直接买断或云租的 TPU——去年 11 月,SemiAnalysis 的已经指出这一点,并披露 Anthropic 承诺采购超过 100 万颗 TPU(约 40 万颗以上直接购买、60 万颗以上经 GCP 租用),主要用于训练、也用于推理。
新报告重申其判断:Anthropic 是 TPU 最大的外部用户,到 2029 年其总用量预计超过 DeepMind 自身。报告还称,其 Accelerator Model 去年率先披露了 Google 直接出售 TPU、而不只是通过 Google Cloud 出租。
执行测量的 InferenceX 是 SemiAnalysis 自己的开源持续推理基准平台(Apache-2.0 协议),公开仪表盘此前已持续发布 GB300/GB200 NVL72、B200、MI355X 等硬件的对比数据,的官方支持列表中,TPUv7x Ironwood Ghostfish 仍标注「即将推出」——本次结果属于其官方预览(Official Preview)阶段的首批 TPU 数据。
叫好之外,还有“选择偏差”的质疑
SemiAnalysis 的 Dylan Patel 在中说,团队「把 Google TPU 的第一批开放基准带给了世界」,测试每天在多个模型和场景上运行,每美元 token 优于 B200 和 B300,并感谢 Google Inferact 团队与 InferenceX 团队数月来的努力。简介为「PyTorch TPU @google」的 Adam Mainz 转发时写道:「谁能想到每美元性能会这么好。」Google DeepMind 开发者关系工程主管 Paige Bailey 则在里用 .to("tpu") 的梗欢迎 PyTorch 开发者「来到 TPU 世界」。
质疑同样存在。简介自称前投资组合经理、曾在 CS 和 GS 任外汇波动率主管的私人投资者 LBM_LXXVIII(@MF_Camillus)在中写道,把 SemiAnalysis 自己的多份报告拼起来看,这次的结论是「对一年前论点的确认」,且「混入了严重的样本选择偏差和投机内容,与作者此前对 Vera Rubin 平台的判断相矛盾」。
无论支持还是质疑,争论的下一份材料已经写明:SemiAnalysis 承诺在后续文章中发布 TPUv7 disagg 对 GB200/300 NVL72 disagg 的对比,这是这批数字之后第一个可以公开核对的节点。
参考链接
- _