AREX Feed Article
VulcanBench 实测 Qwen3.8-Max:默认设置垫底,越努力越倒退
8 月 4 日,独立基准测试机构 VulcanBench 发布了阿里 Qwen3.8-Max 的评测报告。结论刺眼:模型在最低努力档拿下 81.2% pass@1,切到默认档(xhigh)反而跌至 55.1%,26 个百分点的断崖式下滑。
整套测试花费 126.25 美元。同一套题目,DeepSeek V4-Flash 只花了 13.60 美元。VulcanBench 创始人 Morgan Linton 在 X 上的原话是:「Qwen 现阶段根本不在牌桌上。」
VulcanBench v3 评测套件由 23 个真实已合并的开源 PR 任务组成,覆盖 Python、TypeScript、Rust、Go 和 JavaScript。所有任务在 Docker 沙箱内运行,用隐藏测试做确定性判分,每个努力档跑 3 次。
没有谜题,没有抽象数学。Linton 的设计原则是「只测工程团队日常真正会交给模型干的活」。
阿里在 8 月 3 日发布 Qwen3.8-Max 时,将这款 2.4 万亿参数 MoE 模型定位为「仅次于 Claude Fable 5」,并声称 OSWorld-Verified 得分 86.1,超越了 GPT-5.6 Sol Max 和 Fable 5。
但截至报告发布,阿里未公开任何基准测试表、模型卡或方法论。 VulcanBench 的这份报告,是 Qwen3.8-Max 目前最详尽的第三方独立评测。
五个数字看清 Qwen3.8-Max 的真实水平
26 个百分点:从 low 到 xhigh,pass@1 从 81.2% 跌到 55.1%,VulcanBench v3 测试过的最陡峭倒退。此前 Claude Opus 5 在 Report 10 中也出现过倒挂,但只有 9 个百分点。
41% 未完成率:xhigh 默认档的 26 个失败案例,全部是因为没跑完,没有一个答错。错误答案从 low 档的 3 个一路归零(3→0→0),未完成任务则从 10 个涨到 26 个。
10 倍成本:Qwen 跑完全套 126.25 美元,DeepSeek V4-Flash 仅 13.60 美元。每解决一个任务,Qwen 需要 0.75 到 1.19 美元,DeepSeek 不到 0.08 美元。
25.5 分钟 / 任务:xhigh 档平均每任务耗时 25.5 分钟,v3 最慢模型。对比 Kimi K3 的 17.2 分钟。Qwen 在 20 到 25 分钟区间内反复撞上时间预算上限。
5 次 API 超时:xhigh 档有 5 个任务在 DashScope 端点上触发了 600 秒读取超时——单次请求超过 10 分钟,超出阿里自家 API 的响应窗口。VulcanBench 此前从未在任何模型报告中记录过这种情况。
旋钮是倒着转的
Qwen3.8-Max 的努力档枚举是 low、medium、xhigh——没有 high,xhigh 就是最高。而 xhigh 恰好是 API 不传参时的默认值。这意味着任何不做特殊配置的集成,拿到的就是最差表现。
VulcanBench 的完整数据:
| Effort | pass@1 | Solved | Wrong | Unfinished | Cost | Time/task | $/solved |
|---|---|---|---|---|---|---|---|
| low | 81.2% | 56/69 | 3 | 10 | $42.09 | 19.6 min | $0.75 |
| medium | 71.0% | 49/69 | 0 | 20 | $38.81 | 21.7 min | $0.79 |
| xhigh (default) | 55.1% | 38/64 | 0 | 26 | $45.35 | 25.5 min | $1.19 |
xhigh 栏只有 64 次运行而非 69 次,因为 5 个任务在 DashScope 600 秒超时后死亡,被排除而非计零。56 个未完成跑中,38 个死在 45 分钟或 60 分钟的墙上时钟边界,只有 3 个撞上步数上限。卡住 Qwen 的是时间,不是步数。
失败的跑消耗的完成 token 大约是成功跑的 5 倍,耗时约 3 倍。模型不是在偷懒,而是在疯狂思考——只是思考既不产生正确答案,也没在预算耗尽前停下来。
Linton 写道:「effort 把错误答案转化成了未完成跑。」错误答案消失了,不是因为模型变聪明了,是因为它根本没来得及交卷。
不是难题做不出,是会的题也丢了
VulcanBench 把 23 个任务中分数发生变化的 9 个单独拉了一张表。其余 14 个任务在三个努力档得分完全一致。
9 个退步任务中,6 个在 low 档是 3 次全过。这 6 个任务贡献了整个 sweep 中 83% 的分数跌幅,其中 3 个在更高努力档直接归零。
具体看三个典型案例:jiff-strftime-negpad low 档 3/3 全过,xhigh 档 0/3 全败;semver-inc-dotted-prerelease 从 3/3 跌到 0/3;sqlglot-qualify-lateral-star 同样从 3/3 跌到 0/3。模型本来会做,加了推理时间之后反而做不出来了。
还有 3 个任务在所有努力档都是零分——aiohttp-upgrade-deferred、pennylane-trotter-fragmented、sqlglot-canonicalize-internal-names。这些是模型确实解不了的硬骨头。但 Linton 的要点不在这里:「Qwen 输掉的不是难题,是它已经知道怎么做的题。」
10 倍差价,全维度落后
VulcanBench 把 Qwen3.8-Max 和 DeepSeek V4-Flash 放在同一套 v3 套件上跑出了鲜明对比。DeepSeek 三个努力档成绩——88.4%、87.3%、85.5%——每一档都高于 Qwen 的最好成绩 81.2%,误差区间没有重叠。
成本差距更刺眼。$126.25 对 $13.60,接近 10 倍。按每解决一个任务算:Qwen low 档 $0.75,xhigh 档涨到 $1.19;DeepSeek 不到 $0.08。
Grok 4.5 是另一个参照系。VulcanBench Report 07 中,Grok 4.5 在中等努力档拿到 91%,且 $/solved 在所有模型中最低。Linton 的总结:「要准确率选 Grok 4.5,要性价比选 DeepSeek V4-Flash。」
官方「仅次于 Fable 5」,独立测试说「别用」
阿里的定位很清楚:Qwen3.8-Max 仅次于 Claude Fable 5。官方 OSWorld-Verified 得分 86.1,确实压过了 GPT-5.6 Sol Max 和 Fable 5。PaperBench 93.0、TerminalBench 2.1 上 86.6,也都拿得出手。
但 VulcanBench 暴露了一个断层:学术基准和真实工程任务之间的差距。OSWorld 测的是操作桌面系统,PaperBench 测的是复现科研论文——两者与「工程团队日常交给模型的实际代码任务」并不完全重合。VulcanBench 用真实 PR、真实代码库、固定预算,更接近「明天就扔给模型干」的场景。
在这个场景里,Qwen3.8-Max 的 low 档 81.2% 只能算中游。默认档 55.1% 垫底。
Yotta Labs 在发布次日的分析中指出了同一个问题:截至 8 月 4 日,阿里没发布任何基准测试表或模型卡,「second only to Fable 5」仅基于内部评测。 同周发布的竞品 Kimi K3 则提供了完整基准测试表、第三方排名和开放权重。
社区反应迅速分化。SEEK 全球 AI 总监 Thyago Liberalli 写道:「又一个清晰例证,说明公司不该仅凭公开基准选模型,而应该依赖内部评测。」
也有辩护声音。用户 Mirolim Mirzakhmedov 认为问题在评测框架:「在一个简陋的 agent harness 上跑高推理模型是根本错误的测试设置。」Linton 回复:「如果我为每个模型定制 harness,那就不是公平基准了。我自掏腰包做 VulcanBench,要的就是真实、无偏的评测。」
中文社区更直接。@geekbb 总结了三种策略:「完成简单任务用 Grok 4.5 / DeepSeek V4-Flash,挑战困难任务用 Claude Fable 5 / GPT-5.6 Sol。大模型不存在中间档。」
工程团队该怎么选模型
Qwen3.8-Max 在 OSWorld 和 PaperBench 上的亮眼成绩,没有转化为 VulcanBench 上可用的工程表现。模型在学术基准上的排名和真实工程任务中的表现,可以是两回事。
对正在选型的工程团队,这一轮测试提供了三个事实:默认设置(xhigh)就是最差设置,必须显式指定 low 档;无论在哪个努力档,速度和成本都处于当前最差水平;简单任务上的倒退——会的题加了思考反而做不出来——意味着它不适合需要高可靠性的日常编码。
Linton 的判断不带修饰:「这不是一个我能想象工程团队用于日常编码工作的模型。」
VulcanBench 报告留了一个未测试的变量。Qwen API 提供了 thinking_budget 参数,可以显式限制推理预算——报告指出这个参数「最有可能解决本文记录的问题模式」。但由于该参数与 reasoning_effort 互斥,VulcanBench 没有测试它。
如果阿里后续调整默认设置或推荐配置,Qwen3.8-Max 的实际表现可能出现明显改善。但就目前而言,一个默认出厂就跑在倒数第一的模型,很难说服任何人掏钱。