AREX Feed Article
Qwen3.8-27B 首日获四大运行栈支持:单卡 206 tok/s,单 GPU 撑 1M 上下文
北京时间 8 月 14 日 23:32,(@vllm_project)先发出一份 Day-0 支持通告,称 Qwen3.8-27B 整个模型装得进一张 GPU。
此后两个多小时,阿里 Qwen 官方 X 账号(@Alibaba_Qwen)连发五帖,先后宣布:vLLM 无缝集成、SGLang 在单张 RTX 5090 上跑出 206 tok/s、27B 只需 17GB 内存、AMD 硬件自发布首日起即可本地运行、Ollama 上架。8 月 15 日 02:06,独立工程师 Alok 又贴出一份消费级显卡实测:单张 RTX 4090 装下 260K 上下文。
Qwen3.8-27B 是 Qwen 团队 8 月 14 日开放的 27B 稠密多模态模型,官方称其在编码与专业办公任务上有全面提升,262K 原生上下文可扩展至 1M token;权重与配置文件以 Transformers 格式托管在 , 也有同名模型页。
两个多小时,六条通告,四家运行栈
vLLM 项目官方账号的通告发布于北京时间 23:32:Qwen3.8-27B 采用与 2.4T 旗舰相同的混合主干,稠密而非 MoE,「Day-0 support in vLLM」。
Qwen 官方账号随后连发五帖(均为北京时间):23:50 宣布 vLLM 的 ;23:55 宣布 ;8 月 15 日 00:07 宣布 ;00:18 宣布 ;01:44 宣布 。
五条帖文里,只有 SGLang 与 vLLM 两条附了性能数字。
206 tok/s 出自 SGLang 的 Day-0 工作,测试条件未公布
写道:「Yes, we are back, with 206 tok/s on a single RTX 5090!」——我们回来了,单张 RTX 5090 上 206 tok/s。帖文称这是 SGLang 团队出色的 Day-0 工作,并邀请用户经 SGLang(@sgl_project)试用。
这个数字由 Qwen 官方账号转述,帖子本身没有给出量化精度、上下文长度或批次大小等测试条件。
提供了旁证:Qwen3.8-27B 的产物「兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等」,生产或高吞吐场景下 Qwen 建议使用 SGLang、vLLM 或 TokenSpeed 等专用推理引擎。
vLLM 的验证清单:每种精度都能住进一张 Blackwell
列了三点:
- 每种精度都能装进一张 Blackwell GPU:BF16 与 FP8 权重由 Qwen 提供,NVFP4 版本来自 Inferact;
- 262K 原生上下文可拉伸至 1M;1M 长度下一张 GB300 仍有约 6.6M KV token 的余量,可同时跑约六条全长序列;
- MTP 草稿头内置于 checkpoint,投机解码不需要单独的 speculator 仓库;短提示接受率 BF16 92.2%、FP8 84.8%。
通告称已在 NVIDIA GB300 上端到端验证:BF16 与 FP8 用 TP4、NVFP4 用 TP1,工具调用正常,1M 上下文下生成正确。前置条件是 vLLM nightly 与 transformers 5.8.0+。
:低延迟场景用 NVFP4 单卡,最大 KV 缓存用 FP8 TP4,MTP 通过 speculative-config 参数开启。页面还给出机制说明——64 层中只有 16 层跑完整注意力,其余 48 层用线性注意力;并注明 MXFP4 在 NVIDIA 设备上尚不支持(缺线性方法实现),NVIDIA 上要用 NVFP4。
17GB 内存、AMD 显卡,还有一条 ollama run
轻量侧的三条消息同样来自 Qwen 官方账号。打出「27B on 17GB RAM」,并感谢 Unsloth 的推介;称这是一份「给开发者的礼物」——Qwen3.8-27B 自发布首日起就能在 AMD 硬件上本地运行(running locally on AMD from day zero),并感谢 AMD 团队。两条帖子都没有展开具体硬件型号或量化方案。
Ollama 一侧已有可查证的落地:显示 qwen3.8:27b 与 qwen3.8:27b-mlx 两个 tag 已上架。写道:「Qwen3.8-27B is available on Ollama! Any harness you run, the model always delivers.」
4090 实测:262K 上下文装进 24GB 显存
8 月 15 日 02:06(北京时间),独立工程师 Alok(@analogalok,X 简介自述 Mechatronics Engineer)贴出:Unsloth 的 Dynamic Q4_K_XL GGUF 加最新 llama.cpp,跑在单张 RTX 4090(24GB,Ubuntu 22)上。
上下文矩阵的数字:KV 缓存量化为 Q4 时,260K 上下文全量驻留 24GB 显存、无需系统内存卸载,解码 40.70 t/s(prefill 2,659.8 t/s);Q8 KV 下 170K 是「重度 agentic 编码工作流」的甜点位,解码同样 40.70 t/s;不量化的 FP16 KV 到 100K 就碰到 24GB 的天花板。按 Alok 的说法,260K 这一档等于完整的 262K 原生上下文全部驻留显存。
开启原生 MTP 后:MTP 加 Q4 KV 在 130K 上下文下解码 60.10 t/s,MTP 加 Q8 KV 在 80K 下 59.25 t/s。压力测试用一条 142K 的真实提示(Q8 KV):prefill 1,829.50 t/s、解码 31.3 t/s、显存 23.7GB。
他的帖文导语写的是「65 tokens/sec decode with MTP」,表格里 MTP 最高却是 60.10 t/s,两处数字对不上;他同时公开了 llama.cpp 复现参数。Alok 在帖文里写道「The API cartel should be terrified」,并对比称两天前他用 Meta 的 Muse Glimmer 30B 跑 130K 上下文时解码在 50–75 t/s。
待复现的数字,与一条即将上线的 1M 托管版
首日出现的两组数字都停留在当事方帖文里:206 tok/s 的帖子没有给出任何测试条件;Alok 的 4090 数据出自个人贴文,导语的 65 t/s 与表格最高 60.10 t/s 不一致,数据有待复现。
还预告了一条明确的下文:Qwen Cloud 将提供 Qwen3.8-27B 的托管版本,默认 1M 上下文、内置官方工具,页面标注 coming soon。
参考链接
- vLLM 项目官方 Day-0 通告:
- Qwen 官方账号(vLLM Day-0):
- Qwen 官方账号(SGLang 206 tok/s):
- Qwen 官方账号(17GB RAM):
- Qwen 官方账号(AMD day zero):
- Qwen 官方账号(Ollama 上架):
- Alok 独立实测:
- Qwen3.8-27B 模型卡(Hugging Face):
- vLLM Recipes:Qwen/Qwen3.8-27B:
- Ollama 模型库:qwen3.8:
- ModelScope:千问3.8-27B: