AREX Feed Article
Google 悄悄把 TPU Raiden 推理库扔上了 GitHub
8 月 9 日,Google 将 TPU Raiden 推理优化库在 GitHub 上以 Apache 2.0 协议开源。代码仓库在 ,但 README 第一行就写明了态度:仍在活跃开发中,暂不建议用于生产环境。
SemiAnalysis 在 ,指出 Raiden 在推理栈中的定位相当于 NVIDIA 的 NIXL 库——负责在 prefill 和 decode 实例之间传输 KV Cache,并提供 KVCache 卸载原语。该推文 24 小时内获得超过 1199 个赞和 336 个书签,但争议也随之而来。
船的方向盘很便携,前提是你把整条船也带上了
最尖锐的批评来自 X 用户 Ricci Research。他在 SemiAnalysis 帖子下回复:"Raiden 的可移植性,就像船的方向盘一样——只要你把整条船也带上,它就很好用。它的每一行代码都假设底层是 ICI,而这恰恰是 Google 唯一没有拿出来的部分。"
另一位开发者 @plotarmordev 则更直接:"ICI 这部分让它比听起来的 NIXL 等价物差远了。"
Kislay Parashar 从另一个角度切入:"如果 Google 现在开源了 KVCache 传输层,意味着终于有人可以拿 TPU 的推理声明跟 NVIDIA 对账,而不用只靠 Google 自己说了。"
技术招聘领域的 Miss HR 则看到了人才信号:"Google 开源更多 TPU 推理栈,对 AI 基础设施工程招聘是一个强烈信号,这个领域还在加速扩张。"
从 vLLM TPU 到 Raiden,Google 的软件拆墙路线图
Raiden 不是 Google 第一次向外部开发者打开 TPU 软件栈。
2025 年 10 月,Google 与 vLLM 项目合作发布了,将 JAX 和 PyTorch 整合到同一个 TPU 推理运行时下,吞吐量相比初版 TPU 后端提升了 2 到 5 倍。2025 年 11 月,Google 首次公开了 ,包括 XLA 编译器、Pallas 自定义内核语言以及从训练到推理的全流程工具链。
2026 年 4 月,Google 在 Cloud Next 大会上发布了第八代 TPU——训练专用的 TPU 8t 和推理专用的 TPU 8i,这是 TPU 产品线首次按工作负载分拆。据 ,Anthropic 锁定了 100 万颗 TPU 的算力,OpenAI 也已开始将部分推理负载迁移到 Google TPU 上。
Raiden 正是在这个背景下出现的。它补上了 Google TPU 推理栈中一个关键的公开缺口:prefill 实例和 decode 实例之间的 KV Cache 传输。没有这一层,分离式推理(disaggregated serving)在 TPU 上就难以高效运行。
prefill 和 decode 之间的数据高速路
大模型推理通常分两步走:prefill 阶段一次性处理整个输入提示,decode 阶段逐 token 生成输出。在分离式推理架构中,这两个阶段跑在不同的硬件池上,prefill 完成后需要把生成的 KV Cache 快速传给 decode 端。
Raiden 做的事情就是这条数据高速路。根据仓库文档,它提供三种传输模式:
芯片直连传输:单机内通过 ICI 互联在 TPU 芯片之间直接搬运 KV Cache,绕过主机 CPU。
跨 VM 网络传输:在不同 TPU 虚拟机之间通过网络传输 KV Cache,支持将 prefill 和 decode 分布到不同物理节点。
KV Cache 卸载到主机内存:将 TPU HBM 上的缓存块卸载到主机 RAM,释放宝贵的 HBM 空间。仓库还提供了一个共享内存模式(基于 POSIX /dev/shm),允许 KV Cache 在模型服务进程重启后继续保留在 DRAM 中,避免冷启动。
Raiden 同时支持 JAX 和 PyTorch 两种框架路径。JAX 版本的预编译 wheel 已对 Google 内部开放,PyTorch 版本需要从源码编译,且文档注明 PyTorch 路径"仍在成熟中",其端到端性能测试尚未纳入发布门禁。
仓库提供了四个示例场景:DMA 带宽微基准测试、单机双芯片分离式推理、跨 VM 分离式推理,以及单机 KV Cache 卸载。
NIXL 跑在 AWS 上,Raiden 绑在 ICI 上
NVIDIA NIXL 与 Raiden 的对比最能说明问题。 是一个开源、供应商中立的数据搬运库,支持 RDMA、GPU 直发网络、GPU-Direct Storage 等多种后端。2026 年 3 月,NVIDIA 宣布 NIXL 已在 AWS(EFA 网络 + Trainium/Inferentia 加速器)和 Azure(RDMA 网络)上运行,并正在与 Google Cloud 合作接入其 RDMA 和 GPUDirect-TCPXO 网络。vLLM、SGLang、TensorRT LLM 等主流推理框架都已集成 NIXL。
Raiden 则完全不同。它不通过标准 RDMA 或网络协议通信,而是绕过主机直接调用 Google 私有的 ICI(Inter-Chip Interconnect)链路。ICI 是 Google TPU 的专有芯片间互联技术,采用 3D Torus 拓扑,在 上达到每芯片双向 1.2 TB/s。这个互联层从未对外开放过任何规范或驱动。
这意味着 Raiden 只能在 Google Cloud 的 TPU 虚拟机或 Google 自有的 TPU 集群上运行。它不能被移植到 NVIDIA GPU、AMD 加速器、AWS Trainium 或任何非 Google 硬件上。
8 月 4 日,NVIDIA 将通过一个新的跨厂商 GitHub 组织开放其 cuFile API 和存储栈,Google、Intel 和 Meta 都在初始维护者名单中。五天后 Google 放出 Raiden,时间点的接近让这场开源竞赛的轮廓更加清晰:NVIDIA 在通过跨厂商协作扩大生态,Google 则在自家围墙内降低使用门槛。
开源的是上层,锁住的是地基
Google 正在系统性地将 TPU 软件栈的中间层和上层开源——编译器、推理引擎、KVCache 传输库一一对外公开。但这些软件最终都调用了同一个未公开的东西:ICI 互联。
这是 Google 的矛盾之处,也是它的理性之处。对外开放编译器、推理运行时和传输库,可以降低外部开发者在 TPU 上构建应用的门槛,拉拢 Anthropic 和 OpenAI 这样的大客户更深度绑定 Google Cloud。但开放 ICI 意味着交出 TPU 硬件架构中最核心的性能壁垒,让竞争对手有可能复现 TPU 的 scale-up 能力。
Raiden 让外部开发者第一次可以看到 Google TPU 推理栈在 KVCache 传输这一层的真实实现。正如 Kislay Parashar 所说,现在终于可以对账了。