AREX Feed Article
第三方评估落地:AA 智能指数 53 仅列第 16,代理任务确有进步但幻觉率反弹 23%
8 月 4 日,独立评测机构 Artificial Analysis(AA)发布了 Qwen3.8-Max 的首份完整第三方评估——此时距阿里发布仅约 24 小时。此前该模型在 AA 上长期显示"待测",首发报道亦指出"无独立第三方可用于验证官方基准"。如今第一个独立数据点落地。
Qwen3.8-Max 在 AA 智能指数(Intelligence Index v4.1)上得 53 分,位列 186 个模型中的第 16 名。作为参照,同属中国阵营的 Kimi K3 以 57 分领跑开源模型,GLM-5.2 为 51 分;Claude Sonnet 5 同为 53 分,在 AA 体系中,第 16 名的位次意味着前方还有多款模型。阿里官方宣称"性能仅次于 Fable 5"——以 AA 排名观之,至少 Kimi K3 确在 Qwen3.8-Max 之上,但模型无疑已进入前沿竞争圈。
代理能力是最大驱动力,但提升不均衡
AA 详细拆解了评分构成。最大的单项提升来自 GDPval-AA(代理型真实工作任务评估):1599 Elo,较 Qwen3.7-Max 的 1270 飙升 329 分,与 Claude Sonnet 5(1600)几乎持平,但落后 Kimi K3(1687)。AA-Briefcase(长周期知识工作基准)总分 1430 Elo,仅低于 Claude Opus 5、Fable 5、Kimi K3 和 GPT-5.6 Sol 四款模型。
然而提升高度集中于代理编码领域。AA 指出,科学推理类基准几乎持平(HLE +2、CritPt +5、GPQA 未变),而 SciCode 下降 4 分、AA-LCR 下降 4 分、AA-Omniscience 下降 11 分——后者主要因幻觉率从 17% 大幅升至 40%。
成本效率显著落后于 Kimi K3
AA 测算 Qwen3.8-Max 完成一次智能指数任务的成本为 $1.76,与 Claude Sonnet 5($1.72)相当,但约为 Kimi K3($0.86)的两倍、GLM-5.2($0.59)的三倍。成本偏高的部分原因是输出冗长:本次评估共消耗 1.5 亿输出 token,较 Qwen3.7-Max(1 亿)增长 50%。
权重仍未放出
阿里承诺"下周"开源 Qwen3.8-Max 及 Qwen3.8-27B 权重。截至 8 月 4 日,Hugging Face 和 ModelScope 上均未见权重上线。鉴于 Qwen 此前两代 Max 旗舰(3.6、3.7)均以闭源发布且至今未开源,开源承诺的实际兑现仍需等待。