AREX Feed Article
阿里发布 Qwen3.8-Max:2.4 万亿参数 MoE 旗舰上线,即登 LM Arena 第 2,承诺下周开源
8 月 3 日,阿里巴巴正式发布 Qwen3.8-Max,这是 Qwen 系列迄今最大、最强的模型。该模型为 2.4 万亿参数的混合专家(MoE)架构,每次请求激活约 950 亿参数,支持 100 万 token 上下文窗口,原生多模态(文本、图像、视频输入)。API 即日经阿里云 Model Studio 和 DashScope 全球开放,官方承诺下周同步开源 Qwen3.8-Max 与 Qwen3.8-27B 权重——这标志着阿里在连续数代保持旗舰闭源后,重新回到开源路线。
定价与可用性
Qwen3.8-Max 的 API 定价为输入 $2 / 输出 $6 每百万 token,隐式缓存读取 $0.25 / 百万 token,显式缓存创建 $2.50、读取 $0.17。相比竞品,Claude Fable 5 为 $10 / $50,Kimi K3 为 $3 / $15,Qwen3.8-Max 显著低于二者。速率限制为每分钟 200 万 token 和 1.5 万次请求,最大输出 13.1 万 token,推理预算上限 26.2 万 token。
同日,阿里推出 QwenWork 工作 AI 平台(公开测试版),定位为面向个人和企业的一站式生产力工具,对标腾讯 WorkBuddy、Moonshot AI 的 Kimi Work 以及海外 Claude Cowork、ChatGPT Work。
阿里港股当日收涨约 7%,报 HK$125.20。
官方基准:多模态突出,编程不及顶尖闭源
阿里公布了覆盖编码 Agent、通用 Agent、通用能力和多模态/视觉四大类的完整基准表。关键数据如下:
编码 Agent(选取):
| 基准 | Qwen3.8-Max | Claude Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 80.0 | 64.6 | 60.6 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| PaperBench | 93.0 | 88.8 | 90.5 | 64.8 |
多模态/视觉(选取):
| 基准 | Qwen3.8-Max | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| OSWorld-Verified | 86.1 | 85.0 | 83.2 |
| MMMU-Pro | 82.3 | 81.2 | 83.0 |
| OmniDocBench 1.5 | 92.1 | 89.5 | 86.7 |
| Parametric CAD Bench | 91.5 | 87.5 | 86.2 |
| VideoMME | 90.4 | — | 89.5 |
| Dense200 | 87.0 | 31.1 | 55.3 |
多模态和文档理解方面,Qwen3.8-Max 在多数基准上领先;但纯编码和推理方面(SWE-bench Pro、FrontierSWE、DeepSWE),明显落后于 Claude Fable 5。与其前代 Qwen3.7-Max 相比,提升幅度巨大:FrontierSWE 从 40.7 跃升至 73.5,DeepSWE 从 21.6 升至 56.6。
阿里还宣称模型具备长时间自主编程能力——在一个示例中,模型从零构建了名为 "oh-my-cli" 的软件项目,历时约 16 天,产出 265 次提交、127 个 PR 和 151 个 issue。
上线数小时即登 LMSYS Text Arena 第 2 名
根据阿里官方 X 账号发布的截图,Qwen3.8-Max 上线数小时内即在 LMSYS Text Arena 排行榜上攀升至第 2 名。这一快速上升反映了社区对该模型的即时兴趣,但由于排名基于初期投票且可能波动,需持续观察后续稳定性。
争议与未解问题
Nikkei Asia 独立测试:性能不及宣传
日经亚洲(Nikkei Asia)于同日的独立测试报道指出,阿里宣称的"性能接近 Fable 5"并不成立。其分析表明:
- 在 31 项文本和编码测试中,Qwen3.8-Max 仅在 6 项领先,编码类 12 项测试中仅 PaperBench 一项领先;
- 相比其他中国竞品如 Kimi K3 和 GLM 5.2,Qwen3.8-Max 在推理和编程基准上明显落后;
- 阿里未将 Claude Opus 5(Anthropic 于 7 月 24 日发布的最新旗舰)纳入对比表,Kimi K3 和 GLM 5.2 也未出现。
基准方法学存在多处警示
根据多家独立分析,官方基准存在若干方法论上的限制:
- 部分基准为阿里自研(如 QwenSWEBench、QwenQoderBench、QwenReactBench 等),无法外部验证;
- SWE-bench Pro 经修改:阿里自行修正了测试任务中的缺陷后重新评估,导致分数无法与官方排行榜比较;
- 评测模型依赖:PaperBench 由 Claude Opus 4.6 评分,另两项由 Gemini 3.1 Pro 评分;
- 多模态对比基线偏低:官方表格使用 Qwen3.7-Plus(而非更强大的 Qwen3.7-Max)作为前代对比,夸大了代际提升;
- Fallback 风险:阿里注明 Fable 5 的分数可能包含 Anthropic 自动路由到其他模型的情况。
Artificial Analysis 仍标"待测"
截至发布日,Qwen3.8-Max 尚未出现在 Artificial Analysis 的 Intelligence Index 上,也未被收录到 OpenRouter。无独立第三方可用于验证官方基准。BenchLM.ai 给出综合评分 65.4/100,排名第 31/215,并注明其 profile "尚不足获得经过验证的排名位次"。
权重未放出
承诺下周开源的权重目前仍在等待。Qwen 前两代 Max 旗舰(3.6-Max、3.7-Max)同样以闭源发布且至今未开源,开源承诺的实际兑现仍需观察。即使权重放出,2.4 万亿参数的完整模型在 4-bit 精度下仍需约 1.2TB 显存,远超单机部署能力——27B 版本才是实际可自部署的路径。
背景:两周内中国第二个逼近前沿的旗舰
Qwen3.8-Max 的发布距 Moonshot AI 的 Kimi K3(2.8 万亿参数、开源权重)不到三周。阿里持有 Moonshot AI 约 36% 股份,二者形成同一生态内的竞合关系。同期 DeepSeek 也发布了 V4-Flash,Z.AI 的 GLM 5.2 亦在一个月前推出——中国 AI 实验室以密集节奏连续冲击全球前沿榜单。
CNBC 和 Bloomberg 本周均发表定调文章,认为"美国对华 AI 领先优势已基本消失"。Qwen3.8-Max 的发布进一步印证了这一判断,但独立验证的缺失意味着"逼近前沿"的判断仍需更多第三方数据支撑。