AREX Feed Article
Google Cloud 与 Inferact 宣布工程合作:要让 TPU 成为 vLLM 的一等目标,承诺成果全部上游开源
9 月 14 日,Inferact 与 Google Cloud 宣布一项联合的工程与市场推广合作,目标是让 TPU 成为 vLLM 的一等目标(first-class target),双方工程师已经在同一份工程路线图上工作。把开源这一点写得很直接:「这项合作产出的所有东西都是开源的」。同日,也发布了这项合作的消息,称双方要让 TPU 成为开源 AI 推理的一等公民,并列出两项交付:上游开源(upstreamed)的 TPU 内核,以及经 TorchTPU 的原生 PyTorch 集成。
落款旧金山、日期同为 9 月 14 日,工作清单覆盖生产服务特性(production serving features)、优化内核、经 TorchTPU 的原生 PyTorch 路径,以及朝前沿模型 day-0(模型发布当天)支持推进;另有一项社区计划,为开源贡献者提供共享 TPU 算力,并由 vLLM 核心维护者提供评审与设计帮助。
一份路线图,产出全部上游开源
公告说,两个团队共用的这份路线图覆盖服务特性、模型覆盖与市场采用,并确保合作产出的所有东西都开源。Inferact 是 vLLM 创作者与核心维护者创立的公司,做生产推理基础设施;公告称 vLLM 是最广泛采用的开源推理引擎,支持超过 5,000 种模型架构、1,000 种加速器类型,社区有 3,000 多名贡献者。
公告称,成果会到达每一个在 TPU 上部署的人:内核与框架改进带来更快的推理,发布时就有更广的模型支持和更多 TPU 代际支持,以及更短的上生产路径。Inferact 联合创始人兼 CEO Simon Mo 在公告里说:「vLLM 的职责是让模型在最适合任务的硬件上跑得好,而这只在每个推理实现背后都有一支联合团队时才成立。Inferact 和 Google 正在为 vLLM 中的 TPU 把这件事变成现实,在同一个仓库里工作,并向上游开源。我们的目标是让 TPU 上的 vLLM 经过优化、生产可用,服务整个社区。」
TPU 的前沿履历:Gemini、最多 100 万颗芯片与 Ironwood
公告为这项合作补的背景是:TPU 已在前沿规模得到验证。Google 用 TPU 训练并服务 Gemini;Anthropic 多年来用它训练和服务模型,并在去年 10 月承诺把规模扩大到最多 100 万颗芯片;最新一代 Ironwood 是专为推理打造的。公告还称,vLLM 承载着全球推理流量的很大一部分。
Google 方面的表态落在生态与成本上。Google 核心 ML/AI 工程副总裁 Bill Jia 在公告里说:「Inferact 的推理专长,加上团队在 vLLM 和 PyTorch 上的深度,能确保 AI 模型在 TPU 上取得最优的推理性能。我们很高兴与 Inferact 合作建设 TPU 生态,让机器学习开发者和工程师用 TPU 获得更好的生产性能和 TCO(总拥有成本)。」
Agent 负载、服务特性与内核:三层一起改
公告称,Agent 如今占生产流量的很大一部分,它们给服务引擎的压力与聊天不同:Agent 每一轮都要重放一段长对话,把工具输出和截图一路带下去,把上下文推到数十万 token(词元)的量级。公告说,高效服务这类负载需要前缀缓存(prefix caching)这类专门优化,合作正把它们当作 TPU 上的核心服务基础设施来构建。
生产服务特性层面,公告列出的是预填充与解码分离(prefill/decode disaggregation)、投机解码(speculative decoding)、KV 缓存卸载(KV cache offload)、结构化输出与工具调用(tool calling)。目标是这些特性在 TPU 上能够互换组合,既要单独优化和验证,也要在组合状态下优化和验证。内核层面覆盖注意力、MoE(混合专家)、量化与集合通信(collectives)。公告称内核性能决定每一个请求的延迟下限,这部分工作全部上游到开源,供任何人使用和在其上构建。
Google TPU 的 Senior Staff Software Engineer Qi Zhou 在公告里说:「把 Ironwood 交到开发者手里的最快方式,是通过他们已经在用的框架。我们的 TPU 团队正与 Inferact 和 vLLM 维护者一起,把 TPU 原生的注意力和 MoE 内核直接落进开源的 vLLM,任何人都可以读到、改进并在此基础上构建。前面还有很大的空间,但我们有信心做到。」
从 tpu-inference 到 TorchTPU 的一等路径
公告给出的现状是:vLLM 今天已经能跑在 TPU 上,覆盖当前和更早几代硬件。当前后端是 tpu-inference,它在 Ironwood、Trillium 及更早硬件上运行一批生产服务特性,支持 Gemma、Kimi、Qwen 等主流模型,支持状态公开发布,并对可用模型做正确性与性能测试。持续更新的支持矩阵放在 里,覆盖模型、特性与内核。
公告说,社区反馈塑造了路线图,方向转向经 TorchTPU 的原生 PyTorch 方案。Google 今年 4 月推出 TorchTPU,让 TPU 成为原生 PyTorch 设备,并把 vLLM 列入其路线图集成。由于 vLLM 本身就是 PyTorch 代码库,原生 PyTorch 后端意味着在 TPU 上支持一个新模型不再是一个 TPU 专属项目。双方正在 vLLM 上构建一等的 TorchTPU 路径,将在「未来几周内」通过更新后的仓库提供;当前的 tpu-inference 后端今天仍然可用、仍获支持。
day-0 的样板:Kimi K3 与 MiniMax M3
公告给 day-0 定下的目标是:每一个主要模型发布,都能在 TPU 上从第零天做到前沿推理。实现方式是在模型发布前与厂商合作,一个一个把前沿模型带起来,直到从发布到生产服务这条路变成常规流程。
已经发生过的样板是 Kimi K3。公告称,Inferact 在 K3 发布前与 Moonshot AI 合作,共同设计其混合注意力栈(hybrid attention)所需的缓存处理,vLLM 在 day zero 服务了该模型;现在 Inferact 与 Google 正把 K3 带到 TPU,包括它的混合注意力、吞吐优化与低延迟解码(decode)路径。MiniMax M3 走的是同一模式:Inferact 与 MiniMax 合作在 day zero 服务该模型,现在 Inferact 与 Google 正把它在 TPU 上加固。
Inferact 联合创始人兼 CTO、vLLM 创作者与首席维护者 Woosuk Kwon 在公告里解释了这门工作的规模:「在 vLLM 上支持一个新加速器不是一个项目,而是横跨每一个项目:注意力内核、MoE 路由、集合通信、量化、缓存管理。Inferact 工程师和 Google 的 TPU 团队正在一起打通这张组合矩阵,我们每带起来一个模型,下一个都会更便宜。这种复利就是『能跑』变成『day zero 就已优化』的原因。」
共享 TPU 算力与维护者评审,以及公告没给的数字
社区计划有两项具体承诺:一是面向开源贡献者的共享 TPU 算力池,用于在 vLLM 的 TPU 后端上开发和测试;二是由 Inferact 的 vLLM 核心维护者与贡献者为 TPU 贡献者提供专门的 PR(pull request)评审与设计帮助。公告说进展会公开:支持矩阵会标出哪里需要帮助,TPU 相关结果将持续发布在 。
公告没有披露任何性能数据,也没有给出 day-0 支持或 TorchTPU 路径的具体日期。下一个能验证的节点,是公告提到的 TorchTPU 更新仓库。