AREX Feed Article
Qwen3.8-2.4T-A95B 全量权重上线 Hugging Face,Max 级旗舰首次开源
8 月 12 日,Hugging Face 仓库 里的 213 个 safetensors 分片、共 4,892,365,451,008 字节(约 4.89TB)的 BF16 权重全部就位。模型卡写道:"For the first time, Qwen3.8 brings a Qwen-Max-class model to open release."这是 Qwen 第一次把 Max 级旗舰放进开源发布。
仓库记录显示,该仓库 8 月 8 日创建,8 月 12 日 10:24(UTC)最后一次更新;当天起,Hacker News 和 X 上开始围绕这套权重出现集中讨论。8 月 3 日 Qwen 发布 2.4 万亿参数旗舰 Qwen3.8-Max 时,官方账号曾在 :"Next week, the open weights of Qwen3.8-Max will be released."当时官方 API 定价为输入 $2.0/M、输出 $6.0/M token。8 月 12 日正好落在这个"下周"的窗口内。
4.89TB 的 BF16 权重,和一份同日上线的 FP8 版
模型卡公布的架构数字:
- 92 层,隐藏维度 8192,词表 248,320;
- 512 个专家的 MoE,每 token 激活 10 个路由专家加 1 个共享专家;
- 23 组"3×(Gated DeltaNet → MoE) → 1×(Gated Attention → MoE)"混合布局;
- 上下文原生 262,144 token,可扩展至 1,010,000。
权重分 213 个 safetensors 分片,单分片从约 570MB 到 34.4GB,index 文件标注总大小 4,892,365,451,008 字节;实测分片头部 dtype 为 BF16。同日,也完成上传,213 个分片共约 2.50TB。同样列出 213 个分片。
开源版本与官方服务版有明确分工:Qwen3.8-Max 是基于这套权重的官方版,额外提供 vision 输入、可关闭的思考模式、默认 1M 上下文和内置工具;开源的 Qwen3.8-2.4T-A95B 是纯文本模型,思考模式强制开启且不能关闭,支持 reasoning_effort(xhigh/medium/low)调节推理深度。模型卡建议采样参数 temperature=1.0、top_p=0.95、top_k=20,并称兼容 vLLM、SGLang、TokenSpeed。
一份 $50M 门槛的 Max 许可证
随权重发布的 (Hugging Face 元数据里 license_name 记为 qwen3.8-max)条款接近 MIT,但附加两个条件:
- 商业产品或服务月活跃用户超 1 亿、或月收入超 2000 万美元的,须在界面显著展示模型名称;
- 被许可方或其关联公司经营 Model-as-a-Service 或 AI Work Assistant 业务、且任意连续 12 个月合计收入超 5000 万美元的,商用前须单独取得 Qwen 授权。纯内部使用、不向第三方开放模型能力的场景不触发这一条。
PaperBench 93.0:Qwen 自报的五模型对比表
模型卡附了一份基准表,把 Qwen3.8-Max 与 Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol (max)、Qwen3.7-Max 并排对比,几个关键数字:
- PaperBench 93.0,五个模型里最高,高于 GPT-5.6 Sol 的 90.5 和 Fable 5 的 88.8;
- Terminal Bench 2.1 86.6,低于 GPT-5.6 Sol 的 88.8,高于 Fable 5 的 84.6;
- SWE-bench Pro 67.7、FrontierSWE 73.5、DeepSWE 1.1 56.6;
- GPQA Diamond 92.6、HLE 43.6、Agents' Last Exam 27.0(pass)/ 52.4(score)。
读这些数字要带上两条脚注:Fable 5 的结果可能涉及 fallback;Terminal Bench 2.1 上 Qwen 自评用 Claude Code、avg@10、5 小时超时,其他模型取的是各 harness 已发布的最佳成绩。另外,表里列的是官方服务版 Qwen3.8-Max 的成绩,没有单独列出开源 A95B 权重的评测结果。
权重上线当天,DigitalOcean 和 AMD 已经在跑
在 X 上宣布,Qwen3.8-2.4T-A95B 已上线 DigitalOcean Serverless Inference,跑在 NVIDIA B300 上,支持 1M 上下文:"No clusters to manage. Just build."
同步放出 Instinct GPU 的 Day-0 支持,覆盖 SGLang、vLLM、ATOM,并配 Quark MXFP4 量化。
量化这条线,给出了一条路径:全精度需要 4.9TB 存储;动态 1-bit 量化 UD-IQ1_XXXS 的 (缩小 91%),IQ1_S 为 508GB,跑 397GB 版本至少需要约 450GB 内存。中文开发者 称,vLLM、SGLang、Fireworks、Unsloth 均已 Day-0 支持。
截至本文核实时已有 222 分、63 条评论。用户 NitpickLawyer 在评论里指出,官方目前只放出了 BF16 和 FP8 两档权重,没有经过 QAT 的 4-bit 量化版本,上线初期会比 Kimi K3 更难服务。
Qwen3.8-27B 还没出现在 Hugging Face
8 月 3 日同一条预告还提到 27B:"Qwen3.8-27B is also going open-weights to meet you all!"但截至 8 月 12 日,用 Hugging Face API 检索 Qwen 组织下名称含 qwen3.8 的仓库,只返回 Qwen3.8-2.4T-A95B 和它的 FP8 版两个,没有 Qwen3.8-27B。Unsloth 的文档称 27B"will be released this Friday"(即 8 月 14 日)。
Unsloth 同页文档把 Qwen3.8-27B 定位为可在 16GB 以上显存或内存的机器上本地运行的型号;而 4.89TB 的旗舰权重,即便 1-bit 量化也要约 450GB 内存起步。