AREX Feed Article
Lambda 公布 DSX MaxLPS 验证结果:在 16 个节点的功率预算内运行 19 个节点,集群 token 吞吐提升 24%
当地时间 9 月 15 日,在圣克拉拉会议中心举行的 AI Infra Summit 上,NVIDIA 超大规模与高性能计算副总裁 Ian Buck 公布了多项合作与能效结果。据 的峰会记录,AI 云服务商 Lambda 公布的一组数据显示:在 NVIDIA Blackwell 服务器上,Lambda 用 NVIDIA DSX MaxLPS 在原本只够 16 个满功率节点的功率预算内运行了 19 个节点,集群 token(词元)吞吐提升 24%,从约 400 万升到约 500 万 tokens/s,每瓦性能提升 23%。NVIDIA 称,这是 DSX MaxLPS 在 Blackwell 服务器上的首次验证。
NVIDIA 给这轮发布定下的统一口径是「每兆瓦 token 数」。博客称,AI 基础设施的衡量标准正在从峰值性能转向「经过验证的 agentic tokens per megawatt」,也就是每兆瓦功率能产出多少 agentic(智能体)任务所需的 token;AI 工厂需要「从硅到电网」协同设计。这场峰会今年吸引了超过 8,000 名与会者,去年为 3,500 人。同一天,NVIDIA 官方 X 账号发帖写道「每一兆瓦都很重要」,并称 DSX AI Factory Platform 帮助 AI 工厂最大化 AI 产出、提升能效,智能适应不断变化的电网条件()。
Lambda 的验证:同一功率预算,多跑三个节点
据 ,这次验证在五个机架、19 台 HGX B200 服务器组成的集群上完成,用 MLPerf(业界基准测试)的推理和训练负载制造持续、接近峰值的功率曲线,以便得到可复现、可横向比较的结果。
DSX MaxLPS 的做法是实时监控 GPU 与机架级功耗,把可用功率动态移向需求最高处,回收静态配置下闲置的容量。操作上,它允许按策略设置每个节点的功率上限,无需改动正在运行的工作负载,Lambda 测试了 80% 和 85% 两档。NVIDIA 强调训练与推理的功率曲线不同:训练是突发式的,推理更平稳,两类负载交错时,动态分配能把错峰留下的余量变成产出。案例研究给出的基线(16 节点、不加策略)约为 404 万 tokens/s;同样的功率预算里,GPU 容量多出 19%。在 10 个推理节点加 10 个训练节点的并发配置下,推理吞吐提升 20%,训练吞吐提升 17%。
Lambda 云服务总裁 Dave Ward 说:「借助概念验证,我们认为已经跨过了固定功率预算的限制。DSX MaxLPS 为回收闲置容量、把它变成真实用量铺平了道路,同一占地内可以有明显更高的计算密度。」
从峰值性能到每兆瓦 token 数
NVIDIA 称,作为 DSX 平台的核心组件,MaxLPS 通过工厂级功率优化,最多可以把每兆瓦 token 产出提升到 1.4 倍;面向下一代 Vera Rubin NVL72 AI 工厂,在「合适的部署环境」下,同一兆瓦预算内最多可多容纳 40% 的 GPU,token 吞吐最高提升 35%,且不需要新增供电线路。
NVIDIA 称,Vera Rubin NVL72 的 agentic 结果已在 SemiAnalysis 的 AgentX 面板上线;在 DeepSeek V4 Pro 模型上,其每兆瓦吞吐最高可达 GB300 NVL72 的 30 倍,每百万 token 成本最多可低 45 倍()。博客解释,agentic 负载的形状和推理基准历来测量的问答式任务不同:一次会话可能累积数十万输入 token,token 量约为简单聊天请求的 15 倍,输入输出长度的波动也很大;AgentX 用录制的真实 agentic 编码会话来测端到端表现,不采用单请求基准。NVIDIA 的论述是,在功率受限的部署里,每兆瓦吞吐决定 AI 工厂能产生多少收入,每百万 token 成本决定利润率。
NVIDIA 把这归因于深度协同设计:NVL72 的 scale-up(纵向扩展)域与第六代 NVLink 互联、第五代 Tensor Core 上的 NVFP4 精度,以及由 TensorRT LLM 和 Dynamo 组成的推理栈;博客同时称,Vera Rubin 已全面投产。
Groq 3 LPX 为 Vera Rubin 加一层确定性低延迟
NVIDIA 介绍,Groq 3 LPX 为 Vera Rubin 补上确定性的超低延迟推理,与 DSX MaxLPS 互补。NVIDIA 称,与 Vera Rubin 组合后,在 2 万亿参数以上模型、长上下文场景下,每兆瓦 token 吞吐最高可达 GB200 NVL72 的 35 倍;在 100K 上下文的 Qwen 3.8 27B 负载上,Groq 3 LPX 达到每用户每秒 2,529 个输出 token。
产品层面, 把 Groq 3 LPX 描述为 Vera Rubin 的推理加速器,每个 LPX 机架由 256 颗互联的 LPU(语言处理单元)加速器组成;产品页还在性能图表下标注「预期性能,可能变化」。
d-Matrix 接入 NVLink Fusion,Annapurna 共研 NVHBM
Buck 在演讲中还公布了两项合作。其一是 d-Matrix:NVIDIA 博客称,d-Matrix 正在接入 NVLink Fusion,把 NVIDIA Vera CPU 与 d-Matrix 的 Raptor XPU 组合起来,面向大规模的超低延迟推理。其二是 Amazon 旗下的 Annapurna Labs:它与 NVIDIA 合作 NVHBM 定制高带宽内存技术。
Emerald AI 演示:让 AI 工厂回应电网需求信号
电网这一侧,Emerald AI 与 NVIDIA 在 Silicon Valley Power(SVP)的柔性负载互联项目下做了一次演示:系统自动降低负载,成功响应了来自 SVP 的数百次需求信号,同时保住了 AI 工作负载的性能。NVIDIA 的 DSX Flex 负责接收这类电网信号,包括削峰请求、需求响应事件与电价信号,并在预设的工作负载优先级内自动动作:最关键的任务继续运行,其余任务暂缓、之后再恢复。
Emerald AI 计划将 DSX Flex 用于其 Conductor 电网响应式电源管理软件,依据电网实时信号和混合能源动态调整 AI 工厂的能耗。NVIDIA 称,这种能力让 AI 工厂可以充当电网的柔性资源:电网吃紧时压低需求,同时保护优先级最高的 AI 负载,而可控的 AI 负载本身就有助于为电网释放更多容量。
五个机架之后
Lambda 的机队横跨 Ampere、Hopper、Blackwell 与 Vera Rubin 几代 NVIDIA 平台。Dave Ward 把这轮验证称为「一份可扩展、可持续的路线图」,指向 Lambda 今后的运营与扩展。案例研究对推广的措辞是条件句:随着「计划与时间表」逐步明确,Lambda「可能」把 DSX MaxLPS 的功率整形部署到更大的机队。