AREX Feed Article
Groq 3 LPX 全面量产:每秒 3400 tokens,Nebius 机架年内上线
8 月 24 日,NVIDIA 在 Hot Chips 大会期间宣布,交互式推理加速器 Groq 3 LPX 进入全面量产。NVIDIA 在中称,这颗作为 Vera Rubin 平台扩展的芯片,在 Artificial Analysis 基准中运行开源 agentic 模型 Gemma 4 31B(100K 上下文)时录得 3,400 output tokens/s,是该模型有史以来最快的推理速度。
同一天,Nebius 宣布其生产推理平台 Nebius Token Factory 成为。据,NVIDIA 高级总监 Dion Harris 向记者确认,每机架封装 256 颗 Groq 3 芯片的 LPX 机架将于年内上线,与 Vera CPU、Rubin GPU 一同部署于 Nebius。
每秒 3400 tokens:量产官宣拿出的基准
3,400 output tokens/s 是这次量产官宣的核心数字。新闻稿称,在 Artificial Analysis 的评测中,Groq 3 LPX 以 100K 上下文运行 Gemma 4 31B,输出速度创下该模型的公开纪录,并为 agent 与延迟敏感型负载提供比最近竞品平台快 4 倍的响应速度,agentic 任务如编码可以从数小时缩短到数分钟。
生成速度之所以关键,在于 agent 的工作方式。新闻稿解释,agentic 系统要在成百上千次推理步骤中产生海量 token。Nebius 博客补充,每一步都依赖上一步的输出,延迟会在整个工作流中叠加;推理由此被拆成两个任务:处理上下文(长提示、大代码库、多轮状态)与生成 token。Groq 3 LPX 专门加速后者,即单个用户每秒实际拿到多少 token,这决定了一个 agent 检查文件、编写和测试代码、调用工具、验证结果的速度。
NVIDIA 创始人兼 CEO 黄仁勋在新闻稿中称:"推理是 AI 的增长引擎。"他表示,Vera Rubin 以面向 agentic AI 时代的工作负载优化配置延续了这一愿景,"用 LPX 推进性能前沿,实现超快 token 生成"。Vera Rubin NVL72 负责训练与通用推理,Groq 3 LPX 则把 NVL72 的推理 token 生成率再拉高一截。
256 颗 LPU、128GB SRAM:Nebius Token Factory 的机架
Nebius 给出机架配置:每个 LPX 机架集成 256 颗 LPU 加速器、128GB 片上 SRAM 与 640 TB/s 的 scale-up 带宽,采用 NVIDIA MGX 机架架构、全液冷。CNBC 补充,Groq 架构在芯片 die 上内置 500MB 高速 SRAM,以减少内存瓶颈;Groq 芯片由三星代工,NVIDIA 的 GPU 则由台积电制造。
Nebius 强调接入 LPX 不需要重构技术栈。Groq 3 LPX 将运行在开发者已经在用的 Token Factory 平台上,初期支持部分模型,沿用自动扩缩、可观测性等既有功能;对已在 Token Factory 跑生产流量的团队,这是一次模型选择而非迁移,没有新 SDK、新供应商、新账单。Token Factory 本身已提供 serverless 与专用端点、函数调用、结构化输出,以及面向工具调用 agent 的安全护栏,专用端点延迟目标低于 1 秒。
Nebius CTO Danila Shtan 在 NVIDIA 新闻稿中说:"生成阶段决定了 AI 系统实际的响应速度,这正是 Groq 3 LPX 要加速的部分。作为第一个通过 Nebius Token Factory 把它带上生产的 AI 云,我们要让 agent 循环的每一步都感觉是即时的,通过开发者已经在用的同一个 API,无需迁移到新技术栈。"
Nebius 博客还引用 NVIDIA 的预测称,相比 GB200 NVL72,Vera Rubin NVL72 加 Groq 3 LPX 在长上下文、低延迟场景下运行 2 万亿参数模型,每兆瓦推理吞吐最高可提升 35 倍。新闻稿还提到,继 Nebius 之后,专做推理的 AI 云 Groq 公司计划成为 LPX 平台最早的采用者之一。
年内上线:机架与 Vera CPU、Rubin GPU 同场部署
"年内上线"的时间表来自媒体采访。CNBC 报道,NVIDIA 高级总监 Dion Harris 向记者确认,Groq 3 LPX 机架将于今年晚些时候在 neocloud Nebius 上线,与 Vera CPU、Rubin GPU 一同部署。新闻稿补充,LPX 机架平台配备 BlueField-4 DPU,与 Vera CPU 机架、Vera BlueField-4 STX 存储和 Spectrum-6 SPX 以太网协同,为多 agent 系统优化每瓦吞吐与最低延迟推理。
Harris 还解释了这类低延迟算力对云厂商的商业意义:"对于提供 token 服务的厂商,它解锁了向那些对延迟最敏感的用户和客户提供高级别服务的能力。"CNBC 报道,NVIDIA 认为云厂商可以为这类 token 收取更高价格。
从 200 亿美元收购到量产落地
量产官宣背后是 NVIDIA 史上最大的一笔收购。CNBC 报道,2025 年 12 月,NVIDIA 以 200 亿美元从芯片创业公司 Groq 手中收购资产,这是该公司迄今最大的一笔收购。NVIDIA 新闻稿则在版权声明中注明,Groq 与 LPU 商标"由 Groq, Inc. 授权使用"。
产品线在 3 月的 GTC 大会上首次亮相。CNBC 报道,彼时黄仁勋预计 Blackwell 与 Vera Rubin 两代系统到 2027 年的累计销售额将达到 1 万亿美元,并表示会把数据中心中面向编码应用的空间分出四分之一给 Groq 芯片,"其余的数据中心空间 100% 是 Vera Rubin"。Vera Rubin 系统今年早些时候已开始生产,目前正在爬坡出货。
低延迟推理赛道:AMD 牵手 Cerebras,OpenAI 推 Ultrafast
Groq 3 LPX 量产进入的是一个竞争激烈的赛道。CNBC 报道,AMD 今年早些时候宣布将机架级系统与刚上市的 Cerebras 芯片集成,主攻低延迟推理;OpenAI 新公布的 Ultrafast 模式承诺 750 tokens/s,"由 Cerebras 提供支持"。
Harris 强调低延迟芯片与 GPU 的分工:"这不是要取代 GPU,而是用合适的价格、合适的处理器处理工作负载中合适的部分。"CNBC 指出,Groq 这类芯片专注的是模型服务中的 decode(解码)阶段,而 GPU 仍是既能训练又能推理的主力芯片。
量产官宣两天后,NVIDIA 定于周三(8 月 26 日)发布第二季度财报。