AREX Feed Article
腾讯混元三算子杀入 SGLang,Hy3 推理延迟暴降 48.8%
8 月 7 日,LMSYS Org 与腾讯混元联合宣布,HPC-Ops 三大组件已合入 主分支。
三个组件分别是 Dynamic Attention、Router GEMM 与 Fused MoE。
在 8×NVIDIA H20 上实测 Hy3-FP8,端到端 TPOT 最高降低 48.8%,TTFT 降低 3.3–9.0%。
这不是新模型发布。三个 CUDA 算子的代码合并,让 MoE 推理的等待时间直接砍掉近一半。
推文只有 57 个赞,代码已经在生产跑了
LMSYS Org 在 X 平台发布,附完整 benchmark 数据。截至 8 月 9 日,获 57 赞、3 转发、21 书签。
这是典型技术基础设施的传播曲线:不刷屏,被目标读者默默收藏。
AI 技术博主 Niko爱学习:「生产级推理优化愿意反哺开源,比发论文有用。」
他补充:「MoE 服务的痛点是混合长度加稀疏专家的执行开销,静态内核填不满。中小团队吃 SGLang 主分支就能拿到这份提速。」
这三个算子并非实验室原型。HPC-Ops 是腾讯混元在线推理的生产级算子库,已在内部大规模部署。
SGLang 维护方在博客中列出了 H20、H200 上的完整 benchmark 与复现路径。Pull Request 中包含了 Qwen3、Hy3 和 LongCat 的数值精度验证。
HPC-Ops 进了 vLLM,现在轮到 SGLang
HPC-Ops 于 2026 年 1 月由腾讯混元在 开源,目前 1,071 星。
该库聚焦 Attention、MoE、GEMM 等热路径,针对 Hopper 架构优化。
7 月 6 日,HPC-Ops 的 Attention 与 MoE 后端合入 ,在 Hy3-FP8 上 TTFT 降低约 24%。
SGLang 是 HPC-Ops 继 vLLM 后的第二个主流推理框架。与 vLLM 版本相比,SGLang 新增了 Router GEMM 算子。原生后端接口让 HPC-Ops 直连 KV 缓存和路由状态。
8 月 6 日,腾讯 AI 官方账号:
「Open weights are table stakes now. So here's the boring infra nobody wants to tweet about, also open。」
推文列举了已合入 DeepEP 的 RoCE 优化,以及已进入 Dynamo、vLLM 和 TensorRT-LLM 主线的 FlexKV。次日 HPC-Ops 入 SGLang,是这条路线的延续。
Router GEMM:精度不丢,速度翻三倍
Dynamic Attention 解决混合长度 batch 的负载均衡。batch 内请求长度可能相差百倍,静态调度让短请求空转等长请求完成。
HPC-Ops 用持久化 kernel 在每个 decode step 按实际 KV 长度动态分配 tile。
在 1×128K + 31×4K 的极端混合 batch 上,动态调度比静态快 2.95 倍。六种场景平均比 FlashInfer 与 FlashAttention 最优方案快 2.25 倍。
Router GEMM 将 FP32 权重拆为两个 BF16 分量,在单个 kernel 内融合后 scale 校正恢复精度。
在 H20 上比 FP32 cuBLAS 快 1.30–3.22 倍,最大绝对误差仅 0.00177(TF32 为 0.06464)。
Fused MoE 跳过 gather,Gate-Up GEMM 通过路由索引直读原始 token。PDL 消除各阶段 launch 气泡。
在 Hy3 TP1/EP8 上比最优 baseline 快 1.21 倍,Qwen3/H200 上比 Triton 快最多 4.21 倍。
推理成本战,从模型层下沉到 CUDA 层
大模型竞争焦点正在迁移。2024 至 2025 年各家比拼 benchmark 分数和参数规模。
MoE 架构成为主流后,Hy3、Qwen3、LongCat 等模型相继登场。模型能力趋近,推理成本变成产品可行性的硬约束。
HPC-Ops 先后进入 vLLM 和 SGLang 主分支,意味着腾讯将内部验证过的推理优化系统性贡献给开源社区。
SGLang 版本新增的 Router GEMM 和更深的框架集成表明这是一条持续的工程路线。
对使用 Hopper GPU 跑 MoE 模型的团队,pip install 一个 wheel 包,启动命令加两个 backend 参数,就能获得 15.1–48.8% 的 TPOT 降低。
推理框架间的竞争也在加速:谁先集成高性能算子,谁就掌握更多生产部署入口。
最枯燥的工作释放了最大的性能红利
HPC-Ops 的 GitHub star 数(1,071)不到一个普通前端框架的零头。公告推文 57 个赞在 AI 圈连水花都算不上。
但它的三个算子已在腾讯生产集群跑了数月。现在任何人在 H20 上启动一个 SGLang 服务就能拿到同样的加速。
不打榜、不发新模型、不开发布会。三个 kernel 的代码合并,给 MoE 推理带来了比大多数模型迭代更实际的速度提升。