AREX Feed Article
Qwen3.8-Max 拿下 Agentic 指数全球第一,智能指数进前五,但幻觉率翻倍埋下隐忧
8 月 6 日,阿里通义千问官方账号 宣布 Qwen3.8-Max 在 Artificial Analysis Intelligence Index 排名第 5、Agentic Index 排名第 1。同一日,独立评测机构 发布了该模型的完整评测数据:Intelligence Index 得分 56(v4.1.1 更新后升至 58),较前代 Qwen3.7-Max 的 46 分跃升 10 分;在衡量真实世界 agentic 工作能力的 GDPval-AA v2 评测中拿下 1739 Elo,领先 Kimi K3(1685),与 Claude Fable 5(1743)和 GPT-5.6 Sol(max,1730)基本持平,仅次于 Claude Opus 5(max,1852)。
Qwen 公布的排名截图显示其位列 Agentic 指数第一。阿里 Max 系列也首次承诺开放权重——Qwen3.8-Max 的 2.4 万亿参数权重和一个小型 Qwen3.8-27B 模型均计划于 8 月 12 日发布。
从第 46 名到第 5 名:十个百分点的跨越从哪里来
Qwen3.7-Max 在 Intelligence Index 上仅得 46 分,Qwen3.8-Max 的 56 分意味着阿里在不到三个月内将旗舰模型的综合智能评估提升了约 22%。Artificial Analysis 的拆解显示,提升集中出现在三个方向。
Agentic 能力是最大驱动力。 GDPval-AA v2 是 Intelligence Index 中权重最高的评测项(20%),模拟 AI 模型在 44 种职业和 9 个行业中的真实工作任务。Qwen3.8-Max 在该项上拿到 1739 Elo,较 Qwen3.7-Max 暴涨 468 分。Artificial Analysis 指出,这一跃升部分源于模型在每项任务中执行的 agentic 轮次从 14 轮暴增至 64 轮——模型更"主动"了,而非单纯更"聪明"了。
编程和科学推理全面上扬。 Terminal-Bench v2.1 提升 6 分;CritPt 提升 7 分;SciCode 提升 4 分;Humanity's Last Exam 提升 3 分。GPQA Diamond 持平。唯一倒退的是 AA-LCR,下降 2 分。
τ³-Bench Banking 出现离群值。 在金融客服场景的 agentic 工具调用评测中,Qwen3.8-Max 得分 42%,较上一代暴增 32 个百分点,大幅领先多个在 Intelligence Index 总分高于它的模型。Artificial Analysis 在评测线程中特别标注这一结果"out of distribution",暗示其异常性值得进一步验证。
Agentic 登顶的真正引擎是什么
Agentic Index 是 Artificial Analysis 专门衡量模型自主执行能力的综合指标,仅由两项评测等权平均构成:GDPval-AA v2 和 τ³-Banking。Qwen 方面宣称的"全球第一"即基于该指数。
这一排名的精确含义需要审视。Artificial Analysis 的 FAQ 显示,Claude Opus 5(Adaptive Reasoning, Max Effort)以 59 分位列最高,Claude Opus 5(Xhigh Effort)以 58 分紧随其后,Qwen3.8 Max 同样为 58 分。Qwen 方面公布的截图中,可能对推理努力等级(reasoning effort tier)做了筛选,或者排除了 Max Effort 等特定配置。
无论排名口径如何,GDPval-AA 的 1739 Elo 是硬数据。这一分数意味着 Qwen3.8-Max 在需要调用 shell、浏览网页、执行多步操作的开放式工作场景中,已经进入全球第一梯队。Qwen 视觉智能负责人 在引述该成绩时写道:"Multimodal intelligence is moving from understanding to action."
幻觉率翻倍,不能假装没看见
Qwen3.8-Max 在 AA-Omniscience 知识可靠性评测中得分从 +14 暴跌至 +4,倒退 10 分。拆解数据揭示了原因:准确率基本持平(约 31%),但幻觉率从 23% 攀升至 40%。模型在更多自己答不上来的问题上选择了"硬猜"而非拒绝回答。
AA-Omniscience 在 Intelligence Index 中权重只有 4%(非幻觉率),但在实际使用中直接影响用户信任。当一个模型在 40% 的情况下给出看似自信但实则错误的信息,开发者在将其接入生产系统时必须额外增加校验层。用户 在 Qwen 推文下评论:"The hallucination regression is regrettable。"
每次任务 $1.14,是 Qwen3.7-Max 的两倍多
Qwen3.8-Max 的 API 定价为每百万输入 token $2、输出 $6、缓存命中 $0.25。相比 Qwen3.7-Max 的 $2.50/$7.50/$0.50,单价实际有所下降。但运行 Intelligence Index 的单任务平均成本反而从 $0.53 翻倍至 $1.14。
原因不在单价。Artificial Analysis 指出,GDPval-AA 的输入 token 消耗较上一代增长约 15 倍,输出 token 总量从 100M 增至 145M。模型在每项 agentic 任务中花费了更多轮次去探索、试错和迭代,这既是能力提升的表现,也是成本增加的来源。
放在竞争语境中:Kimi K3(max)每任务成本 $0.86,得分 57;GLM-5.2(max)每任务 $0.57,得分 51;Claude Opus 4.8(max)每任务成本 $1.78。Qwen3.8-Max 比最强的中国对手 Kimi K3 贵 33%,但得分反而低 1 分(在 v4.1 口径下)。对价格敏感的开发者来说,这个性价比等式需要根据自己的 workload 重新计算。
2.4 万亿参数即将开源,Max 系列史上第一次
Qwen3.8-Max 于 8 月 3 日正式发布,距 7 月 19 日上海世界人工智能大会预览仅两周。模型采用稀疏 MoE 架构,总参数 2.4 万亿,每次前向传播激活约 950 亿参数,支持 100 万 token 上下文窗口,原生多模态(文本、图像、视频输入)。
阿里承诺开放权重——这是 Max 系列首次。此前 Qwen3.7-Max 等旗舰型号均为 API 专有。同时公布的还有一个较小的 Qwen3.8-27B 密集模型,二者均计划于 8 月 12 日发布权重。Qwen3.8-Max 一旦开源,将成为仅次于 Kimi K3(2.8 万亿参数)的全球第二大开源权重模型。
在 中,Qwen3.8-Max 展示了多项 internal testing 成果:在无人类干预的情况下自主执行了一个为期 16 天的软件工程项目,从零构建了名为 oh-my-cli 的自进化 agent 框架;在 WWW2025 多模态对话意图识别挑战赛中超越人类选手;在内部 RecreationBench 评测中仅通过交互和视觉反馈从零复现完整应用。
但这些成果目前仍是 vendor claim。阿里在发布时没有随附完整的基准测试表和模型卡。
中国模型阵营的格局位移
Qwen3.8-Max 的排名公布,与 Kimi K3 的发布(7 月 27 日,2.8 万亿参数,开源权重)仅隔一周。两个模型的策略分野鲜明:Kimi K3 首发即开源,以更大的参数规模和更早的第三方验证抢占"中国最强开源模型"的叙事;Qwen3.8-Max 则先以 API 上线,用更低的输入/输出价格($2/$6 vs K3 的 $3/$15)争夺开发者,再用一周后的开源权重补上生态位。
从 Artificial Analysis 的数据看,Kimi K3 在 Intelligence Index 上仍以 57 分领先 Qwen3.8-Max 的 56 分(v4.1 口径),但在 Agentic Index 和 GDPval-AA 上已被反超。GLM-5.2(智谱)以 51 分位居第三梯队。中国 AI 实验室的前沿模型正以月为周期交替领先,且均指向同一个方向:agentic 能力是当前阶段的关键差异化维度。
在 X 平台上,用户 评论道:"top 5 overall is massive for an open source drop。"用户 则指出:"model performance on general benchmarks is starting to decouple from agentic task execution"——通用基准与 agentic 执行能力正在脱钩。
也有声音表达怀疑。 写道:"User cases are not resulting in such scores. Something is fishy. Maybe benchmaxxing?"