AREX Feed Article
Artificial Analysis 将评分模型统一换为 GPT-5.6 Luna,Claude Opus 5 以 63 分守住榜首
8 月 6 日,独立 AI 评测机构 Artificial Analysis 发布了 ,将 HLE、AA-LCR 和 AA-Omniscience 三项评估的评分模型统一更换为 OpenAI 的 GPT-5.6 Luna (medium)。这是一次补丁级更新:大部分模型的 Intelligence Index 分数变动不到 1 分,Claude Opus 5 以 63 分继续位居第一。
评分模型的选择、榜首模型在用户群体中的口碑分裂、以及顶部日趋收窄的差距,让这次补丁更新牵扯出的问题比排行榜上的数字变动要大得多。
大多数模型分数变动不到 1 分
Artificial Analysis 将此次更新定性为一次"补丁发布"(patch release),目标不是添加新评估,而是让现有评估体系更可靠。实际分数变化也印证了这一点:绝大多数模型的 Intelligence Index 变动不到 1 分,排名几乎没有移位。
根据 Artificial Analysis 公开排行榜数据,v4.1.1 下的前 14 名得分和单任务成本如下:
| 模型 | 得分 | 单任务成本 |
|---|---|---|
| Claude Opus 5 | 63 | $2.34 |
| Claude Fable 5 | 62 | $3.14 |
| GPT-5.6-Sol | 61 | $1.23 |
| Kimi K3 | 60 | $0.84 |
| Qwen 3.8 Max | 58 | $1.13 |
| Claude Opus 4.8 | 57 | $2.03 |
| Muse Spark 1.2 | 57 | $0.40 |
| GPT-5.6-Terra | 57 | $0.51 |
| Grok 4.5 | 56 | $0.36 |
| Claude Sonnet 5 | 55 | $1.72 |
| GLM-5.2 | 53 | $0.54 |
| GPT-5.6-Luna | 52 | $0.05 |
| DeepSeek V4 Flash | 52 | $0.03 |
| Gemini 3.6 Flash | 52 | $0.56 |
前三名的分数分别是 63、62、61,差值各只有 1 分。而排名第 5 的 Qwen 3.8 Max(58 分)距离榜首也不过 5 分。在 Intelligence Index 的 95% 置信区间小于 ±1% 的前提下,前五名之间的差距已经窄到统计噪声的边缘。
唯一值得注意的跃升来自 Meta 的 Muse Spark 1.2(xhigh 推理配置),得分从上一版本提升 2.7 分至 57 分,与 Claude Opus 4.8 和 GPT-5.6-Terra 并列。Artificial Analysis 未单独解释这次跃升的原因,仅笼统归因于"评分鲁棒性的改善"。
三道变更,一个逻辑
v4.1.1 实际上做了三件事,背后是同一个逻辑:让评分更接近人类判断。
τ³-Banking 升级至 Sierra v1.0.1。 τ³-Banking 在 Intelligence Index 的 9 项评估中权重排在第三(14%),测试模型在银行业务场景下的 agentic 能力。旧版本存在一个 bug:当 agent 在执行任务时遇到异常路径但最终成功恢复并完成任务,评分器仍将其判定为错误。Sierra v1.0.1 修复了这一问题,同时更新了上游任务版本。这是一个纯粹的正确性修正,对大多数模型的分数影响微乎其微。
三项评估的评分模型统一为 GPT-5.6 Luna。 这才是本次更新的核心动作。在 v4.1 版本中,HLE(Humanity's Last Exam)由 GPT-4o 评分,AA-LCR(长上下文推理)由 Qwen3 235B A22B 2507 评分,AA-Omniscience(知识准确性)由 Gemini 3 Flash Preview 评分。v4.1.1 将这三项全部交给 GPT-5.6 Luna (medium) 统一评分。
Artificial Analysis 的解释是:GPT-5.6 Luna 在其内部的评分器验证中与人类判断的一致性最高。他们在中写道:"这些检查现在统一在一个能力更强的现代模型之下,该模型在我们的评分器验证中与人类判断表现出高度一致性。"
分数小幅普涨。 由于新评分模型更准确,或者说更"宽容",大多数模型的分数略有上升。但上升幅度极小,不改变任何实质排名。
用 OpenAI 的模型给 OpenAI 打分?
GPT-5.6 Luna 是 OpenAI 的产品。而 Intelligence Index 排行榜上排在第三的 GPT-5.6-Sol 同样来自 OpenAI。这种安排立即引发了社区的质疑。
"在那些同时也给 OpenAI 模型排名的指标上使用 GPT-5.6 Luna 作为评分器,这一点值得追问,"用户 在回复中写道,"评分器验证是否测试了'同家族偏袒'——也就是 Luna 对 OpenAI 产出的评分是否与一个中性评分器在相同轨迹上的评分存在差异?"
另一位用户 则从另一个角度切入了问题:"用一个在 AA 自有幻觉评估中表现最差的模型来当评分器?希望你们确实跑过所有模型的矩阵测试,确认它真的是最好的评分器。"
这两种批评指向同一个结构性问题:当评测机构自身不生产模型时,它必须从被评测者中挑选裁判。而无论选谁,利益冲突的嫌疑都无法完全消除。
GPT-5.6 Luna 被选中的理由是"与人类判断一致",这是一个技术性答案。但它回避了一个更根本的问题——为什么不能用多模型陪审团或纯规则评分来替代单一模型裁判?
在 v4.1 时代,三项评估分别使用三家不同公司的模型(OpenAI、Alibaba/Qwen、Google),天然形成了一种制衡。统一为单一模型后,这种制衡消失了。
63 分的 Opus 5,和用户手里的 Opus 5
如果只看榜单,Claude Opus 5 是第一。但如果看评论区,情况完全不同。
"我认识的每个大量使用 Opus 5 的人都不会同意它排第一,"用户 写道。"关于 Opus 5 的反感太多了,它怎么可能排第一?这个基准测试真的有问题," 补充道。用户 更直接:"没有任何合理的理由让 Opus 5 在任何智力指标上领先。"
也有声音试图调和这种矛盾。用户 的判断是:"Opus 5 可能比通常的 Claude 发布更'刷榜化'(benchmaxed)。它在混乱的真实上下文中保持锐度的能力确实很差。"用户 则指出了另一个维度:"Claude Opus 5 以 63 分守住第一,而其他模型在几分之内洗牌——这更多说明了差距已经变得多窄,而不是某个单一模型在拉开距离。"
这种用户体验与基准分数的分裂并非 Opus 5 独有。它反映的是综合性指标固有的局限:Intelligence Index 将 9 项评估加权合成为一个数字,必然抹平了不同模型在不同任务类型上的优劣差异。
一个在 GPQA Diamond(研究生级科学推理)上表现出色但在实际对话中容易跑偏的模型,可能在指数上看起来很强。
顶部在收窄,社区在等下一件事
Artificial Analysis 的 Intelligence Index 是目前独立评测领域最受关注的综合指标之一。但社区中越来越多的人开始要求更新评估套件。
"把 HLE 换成 HLE-Verified,再加一个 DeepSWE,"用户 建议,这条回复获得了 16 个赞——在本次更新的评论区中属于高赞。用户 追问得更具体:"你们什么时候把 Terminal-Bench 2.1 换成 FrontierBench、DeepSWE、FrontierCode——任何还没饱和的基准?"
用户 的观察或许最接近当下的真实状态:"这个指数不断添加维度,但排名似乎从来没怎么动过。"
用户 的注意力则放在另一个数字上:"真正值得关注的是 #1 和 #5 之间的差距在以多快的速度收窄。六个月前这个差距要大得多。"
这两句话点出了一层更深的问题:当所有顶级模型在现有评估体系上趋于收敛,继续修补评分模型只能维持表面的区分度。真正需要的是更能拉开差距的任务,那不是一次补丁更新能解决的。
Artificial Analysis 在方法论文档中表示, 的 95% 置信区间小于 ±1%。如果前三名之间只有 1 到 2 分的差距,那么从统计角度看,Claude Opus 5、Claude Fable 5 和 GPT-5.6-Sol 之间的排名几乎可以视为平局。