AREX Feed Article
Qwen3.8-Flash-Next 权重正式开源,NVIDIA 同日验证单 GPU 超 16K tok/s
8 月 26 日 UTC 12:34,Qwen 官方账号宣布开源 Qwen3.8-Flash 与 Qwen3.8-Flash-Next 权重(、)。同日 UTC 17:07,确认对该模型的 Day-0 支持:SGLang、vLLM、TensorRT-LLM 推理,NeMo AutoModel 的 SFT/LoRA 微调与 NeMo RL 强化学习;并公布在 GB300 NVL72 上验证 agentic 编码性能的结果,单 GPU 吞吐超 16K tok/s、单用户超 200 tok/s。
发布前几小时,社区对这款模型的认知还停留在一份被迅速撤下的 ModelScope 页面:125B 主参数 + 51B N-gram 嵌入、每 token 仅 6B 激活、计划当天发布()。当天,这些数字逐一写进了官方权重页与仓库发布说明,与预告一致。
125B + 51B:被撤下的页面,写进了官方模型卡
公开了完整配置:125B 主模型参数 + 51B N-gram 嵌入 + 4B MTP 模块,48 层,512 个专家,每 token 激活 10 路由 + 1 共享;原生 262,144 token 上下文,经 YaRN 可扩至 1M。权重与配置为 Transformers 格式,兼容 Transformers、vLLM、SGLang、TokenSpeed。
GitHub 发布说明把模型定位为 Qwen4 架构的早期预览:与当年 Qwen3-Next 之于 Qwen3.5 的角色相同,提前开放注意力、残差、嵌入、优化四个方面的架构创新,即 Gated DeltaNet(GDN)+ Qwen Sparse Attention(QSA)混合注意力、Gated Residual 残差、N-gram Embedding 嵌入与 Muon 优化器。说明还披露,该模型已驱动新发布的 QwenWork「Standard」模式与 Qwen Code 开源终端 agent。
官方同时公布自报基准:DeepSWE 1.1 58.7、SWE-bench Pro 62.5(高于表中 Claude Opus 4.6 Max 的 53.4)、CoWorkBench 73.9、AndroidWorld 84.5、MathVision 95.7(含 CI),并称训练成本约为 Qwen3.7-Plus 的 1/9。生产版 Qwen3.8-Flash 即将经 QwenCloud API 提供,定价每百万输入 token 0.16 美元、输出 0.47 美元。
NVIDIA 的 Day-0:三套推理栈、NeMo 微调,单 GPU 超 16K tok/s
NVIDIA 博客作者、高级产品营销经理 Rajath Narasimha 称,NVIDIA 提供「best-effort」的 Day-0 功能支持:SGLang、vLLM、TensorRT-LLM 三套推理栈,GB300 NVL72 推理验证,以及 NeMo AutoModel 与 NeMo RL 的后训练配方。其中 NeMo AutoModel 可直接加载 Hugging Face checkpoint,无需模型转换,支持全参 SFT 或内存高效的 LoRA 微调。
博客解释了 GB300 NVL72 上吞吐的来由:72 块 Blackwell Ultra GPU 组成单一 NVLink 域,全互联带宽 130 TB/s,MoE 的专家流量不必跨传统网络。验证结果是单 GPU 超 16K tok/s、单用户超 200 tok/s;本地硬件同样可跑,包括 DGX Station、DGX Spark 集群和四张 RTX PRO 6000 Blackwell Max-Q Workstation Edition 显卡的工作站,可先在本地验证 agentic 编码流程,再上 GB300 NVL72 生产。
性能来自混合架构:每四层中三层用 GDN 把历史上下文压缩成固定大小的循环状态,KV cache 不再随序列增长;剩下一层用 QSA 做全上下文检索,把序列聚成 micro-block、按块估计重要性、只选最相关的区域。关于 QSA 的效率,博客转引阿里已公布的数据:相比全注意力,1M token 工作负载下 prefill 最高提速 7.6 倍、decode 4.9 倍;在 1M 上下文、90% prefix-cache 命中率的在线服务测试中,prefill 吞吐为 Qwen3.7-Plus 的 8.6 倍。这组数字来自阿里,并非 NVIDIA 实测。
vLLM 当日集成,4090 单卡跑出 250K 上下文
(UTC 13:11)宣布 day-0 支持,并已在 NVIDIA 与 AMD GPU 上验证。实现细节透露了架构的部署特性:GDN 层复用 vLLM 自 Qwen3-Next 以来的 KV 路径,只有四分之一的层持有增长的 KV cache;51B 的 N-gram 表可用 VLLM_PLE_CPU_OFFLOAD=1 放到主机内存;QSA 是新引擎工作的重点,当前模型从 vllm/vllm-openai:qwen38-flash-next 镜像运行。
独立开发者 Alok 当天晚些时候(UTC 19:33)发布了消费级硬件实测:单张 24GB RTX 4090 配 110GB DDR4 内存,跑出 250K 上下文窗口,decode 约 21 tok/s、prefill 364 t/s()。他用的是 llama.cpp 实验分支(PR #27742,作者 @danielhanchen)和 111.4GB、分 4 个分片的 GGUF 量化权重;把 512 个专家层全部固定到 DDR4(-cmoe)后,80K 上下文下 VRAM 占用从 23.85GB 降到 11.66GB,decode 从 22.52 降到 20.84 t/s。他在推文中写道:「The VRAM barrier is officially dead(显存壁垒正式宣告死亡)。」这是个人环境的结果,未与官方基准对照。
自报基准还没被复现,QSA 适配仍在路上
模型卡与官方推文中的基准均为厂商自报,尚未经独立评测完全复现;Alok 的 4090 数据同样没有与官方数字对比。vLLM 明确说 QSA 是新的引擎工作所在,NVIDIA 也把 Day-0 称为「best-effort」。稀疏注意力在主流推理引擎里的适配仍在推进。
边界同样清楚:开源的 Qwen3.8-Flash-Next 是实验性预览,官方把生产路径放在 QwenCloud,基于它的 Qwen3.8-Flash 默认 1M 上下文、内置官方工具。权重已可下载、三套推理栈已可跑、NVIDIA 已给出 GB300 NVL72 的部署数字,接下来要验证的是:这些自报数据在社区手里能复现多少。
参考链接
- (架构示意图来源,模型卡内嵌图)