AREX Feed Article
Qwen3.8-Max 将开源:2.4 万亿参数旗舰首次免费
8 月 3 日,新一代基座大模型 Qwen3.8-Max,总参数 2.4 万亿,激活参数约 950 亿,上下文窗口 100 万 Token,原生支持文本、图像与视频多模态输入。同日 最新放榜,Qwen 系列整体表现仅次于 Anthropic 的 Claude 系列,跻身全球第一梯队()。
阿里同步宣布:Qwen3.8-Max 模型权重将于下周在 Hugging Face 与 ModelScope 正式开源,同时开源的还有轻量版 Qwen3.8-27B。这是千问 Max 级别旗舰模型首次对外开源()。此前从 Qwen-Max 到 ,最强模型始终锁在 API 付费墙后,开源线另走一条能力缩水的路径。这一次,阿里自己把这条界限抹掉了。
Arena 第二,Agentic Index 第一
Qwen3.8-Max 在多个第三方基准测试中的位置已经可以核对。
Arena 放榜结果:Text Arena 第五,Vision Arena 第二,Code Arena 第四。三条赛道均进入全球前五。8 月 6 日, 将 Qwen3.8-Max 列为其 Agentic Index 第一名。
阿里官方公布的基准测试表中( 整理),几个关键数字:
- PaperBench(科研复现)93.0 分,领先 GPT-5.6 Sol Max 的 90.5 和 Claude Fable 5 的 88.8。
- OSWorld-Verified(智能体桌面操作)86.1 分,高于 Fable 5 的 85.0、GPT-5.6 Sol Max 的 83.2。
- Terminal-Bench 2.1(终端智能体)86.6 分,仅低于 GPT-5.6 Sol Max 的 88.8,高于 Fable 5 的 84.6。
- GPQA Diamond(研究生级科学推理)92.6 分,与 Fable 5 持平。
弱项同样摆在桌上。SWE-bench Pro(真实代码库修 Bug)67.7 分,明显落后 Fable 5 的 80.0。DeepSWE 1.1 仅 56.6 分,与 GPT-5.6 Sol Max 的 73.0 差距显著。在软件工程这条硬赛道上,Anthropic 仍有代差优势。
整体画像清楚:自主智能体、多模态理解和科研复现在前沿甚至领先位置,但深度代码库工程尚未追平最强闭源模型。
16 天,265 次提交,零人工干预
阿里在中展示了 Qwen3.8-Max 的长程自主执行能力——无人干预、跨天级别的持续任务运作。
编程自主性演示中,模型从空文件夹出发,被要求构建一个"自进化的 CLI 工具"。在约 16 天的完全自主运行中,Qwen3.8-Max 累计完成 265 次代码提交、127 个 PR、151 个 issue,最终交付了名为 的可运行项目,完整开发轨迹已在 GitHub 公开。
科研复现演示中(),模型拿到一篇论文和 GPU 预算后独立工作约 125 小时:前 37 小时完整复现论文六项结论,后 88 小时自主提出 18 种改进方向并完成四轮实验迭代,最终在 AIME24 数学基准上将原论文方法提高了 2.71 分。全程自主写出 7600 行代码、执行 33 轮 GPU 训练。
量化策略演示中,模型将 6 条因子描述拆解为 300 个研究方向,调度约 330 个子智能体并行回测约 6000 次,过程中自主识别过拟合信号、裁剪冗余因子、切换集成框架,最终选出的因子超额夏普比率在 0.64 至 1.48 之间。
这些都是厂商演示,不是第三方验证。但它们指向同一个方向:Qwen3.8-Max 被设计来跑"设好目标就放手"的任务,而不是一问一答的聊天。
阿里为什么拆了自己搭的墙
Qwen 系列过去有一条不成文的界线:Max 旗舰走闭源 API 收费,开源线另起一套能力有上限的模型。从 Qwen-Max 到 Qwen3.7-Max,这条规则从未被打破。
此次 Qwen3.8-Max 连权重一起交出来,需要放到近一个月的中国大模型时间线里看。
7 月 27 日,月之暗面发布 ,2.8 万亿参数,权重直接开放下载。同一窗口期内,DeepSeek V4 Flash 以 $0.14/$0.28 的极低价格走量。8 月 3 日,Qwen3.8-Max 以 2.4 万亿参数加入开源队列。
中国头部 AI 实验室,在一个月内各自交出了万亿参数级别的开源或开放权重模型。节奏压缩到以周为单位。
社区反应迅速。量化工具方 在 Qwen 官宣推文下回复:"Qwen3.8-27B?感谢 Qwen 团队!我们所有人的梦想成真了!"该回复获 2752 赞。多位开发者追问 35B-A3B 等更小尺寸版本何时跟进——本地运行 2.4T 模型不现实,但他们看中的是开源体系内能力逐级下放的可能性。
开源编程工具 、、 均在发布当天宣布接入 Qwen3.8-Max。 在发布前一天已将模型列入目录。 在 8 月 6 日发推:"首个开源 Qwen-Max 级模型即将到来,准备就绪。"
阿里港股当日上涨 7.01%,收报 125.2 港元()。
$2 输入、$6 输出:定价战的另一面
Qwen3.8-Max 的定价延续了中国 AI 实验室以价换量的策略。国际 API 每百万 Token 输入 $2、输出 $6、隐式缓存命中 $0.25;国内定价每百万 Token 输入 ¥12、输出 ¥36。
放在当时的市场坐标里看:据腾讯新闻测算,Qwen3.8-Max 国际 API 价格仅为 Claude Opus 5 输入的 40%、输出的 24%。GPT-5.6 Sol Standard 合计 $35/百万 Token。Kimi K3 的国际价是 $3 输入 / $15 输出——Qwen3.8-Max 输出价格不到它的一半。DeepSeek V4 Flash 以 $0.14/$0.28 守住最低价位,但那对应的是纯文本模型、能力层级不同。
缓存定价是对长程智能体工作负载的定向让利。隐式缓存命中 $0.25/百万 Token 意味着反复读取同一代码库或文档集的智能体循环,输入成本可以压缩到标准价的八分之一。这与 Qwen3.8-Max 主打的自主编程和长程任务定位完全一致。
开源不是终点
与半年前相比,变化不在参数大小:2T 与 2.8T 对实际使用的影响远不如架构设计和训练数据。真正的变化在开源策略的全面反转。当阿里把最强的模型也放进开放权重池子,闭源模型的溢价空间被系统性压缩。
但"下周开源"这个承诺在发稿时仍是承诺。截至 8 月 9 日,Hugging Face 和 ModelScope 上还没有 Qwen3.8-Max 的权重文件,许可证条款也未公布。2.4T 参数的 BF16 存储需求约 4.8TB,即使量化到 4-bit 仍需约 1.2TB——对绝大多数开发者和中小企业而言,这个模型依然只能通过 API 调用。
真正的变量在 Qwen3.8-27B。这个能在单机 GPU 上跑的轻量版,才是开源生态里最可能长出实绩的种子。