AREX Feed Article
Claude Opus 5.5 以 58 分成为 Artificial Analysis 智能指数最高分模型:每任务 5.98 美元,领先 GPT-6 Sol 10 分
独立评测机构 Artificial Analysis 于北京时间 9 月 24 日凌晨(UTC 时间 9 月 23 日 18:54)在 中更新了本周 Intelligence Index(智能指数)对每任务成本的帕累托前沿(Pareto frontier,即曲线上没有任何模型能以更低成本拿到更高分):Anthropic 的 Claude Opus 5.5 在其标注的 max with fallback 配置下测得 58 分、每任务成本 5.98 美元,按该机构口径成为最高分模型;OpenAI 的 GPT-6 Sol(max)为 48 分、1.06 美元,小米 MiMo-V2.6-Pro 为 46 分、0.13 美元,GPT-6 Luna(max)为 37 分、0.068 美元。
Opus 5.5 是 Anthropic 于 9 月 22 日发布的旗舰模型,发布日期见 。此前的独立评估报道已涵盖 METR 判断其在 AI 研发任务上提升温和,以及同一机构测算的每任务约 5.98 美元成本;这次更新的新增信息,是 58 分的得分、「最高分模型」的排名,以及与另外三款本周旗舰的量化对比。
一次更新新增 11 个前沿点,Opus 5.5 包揽总分前三
Artificial Analysis 称,这条「得分—成本」曲线本周因 MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna 与 GPT-6 Sol 四款模型的发布而整体移动,共留下 11 个新前沿点,由各模型在不同 reasoning effort(推理努力)档位下的评测产生:GPT-6 Luna 一个模型贡献 5 个,Claude Opus 5.5 贡献 4 个,MiMo-V2.6-Pro 与 GPT-6 Sol 各 1 个。
机制上,该机构对每个模型的各个档位分别跑完整套指数,每个档位得到一组「得分、每任务成本」坐标;只有不被任何其他坐标同时在两项上压过的点,才留在前沿曲线上。Opus 5.5 贡献了其中 4 个点:显示,Opus 5.5 的 max、xhigh、high 三个档位分别以 58、56、54 分位列全部 169 个被测模型的前三名,第四、五位是 Claude Fable 5.1 的两个档位(各 53 分)。
从 0.068 到 5.98 美元:一条曲线上的 88 倍成本差
Opus 5.5 比 GPT-6 Sol 高 10 分,成本约为后者的 5.6 倍;比 GPT-6 Luna 高 21 分,成本约为后者的 88 倍。四个模型都留在前沿曲线上,按 Artificial Analysis 的口径,各自代表某一价位段的当前最优解:Luna 把低端做到 0.068 美元一题,Opus 5.5 把分数上限抬到 58 分,MiMo-V2.6-Pro 以 46 分成为榜上排名最高的开源权重(open weights)模型。
成本数字有明确口径。模型页列明,Opus 5.5 按 Anthropic API 定价为每百万 token 输入 4 美元、输出 20 美元,上下文窗口 100 万 token;在整套 Intelligence Index 上评测一次平均花费 5.98 美元,评测过程共产出约 2.6 亿 token,约为全部被测模型中位数(8,800 万)的 3 倍——高分与高消耗直接挂钩。这一版 Intelligence Index v4.3 由 10 项评测构成:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 与 AA-LCR v1.1。
至于 max with fallback,完整写法是 Adaptive Reasoning, Max Effort, Default Fallback(自适应推理、最高 effort 档、默认回落),58 分对应的正是这套最高档设置。
一道研究题的对立样本:发布周里的实测冷水
榜单更新前近 15 个小时, 在 X 上发出了对 Opus 5.5 的负面一手实测。他写道,让 Opus 5.5 研究一个自己近期学到的较难问题,「它答错了。Astra 答对了」;编码场景下,他也觉得 GPT-6 Astra 仍然更好。他由此重申此前的判断:前沿 LLM 的编码能力已进入平台期,竞争正转向「每美元智能」(intelligence per dollar)。
这是一道题、一个人的体验,他自己也用了「感觉上」(feels better)这样的措辞;截至本文查询,该帖获得 1,118 个赞、129 条回复和 102,036 次浏览,是发布周里传播较广的反例。他所说的「每美元智能」,正是 Artificial Analysis 这张前沿图的两个坐标轴。
尚未闭合的问题:自建口径与档位依赖
58 分和「最高分模型」的排名出自 Artificial Analysis 的自建测试,属于该机构对自己评测结果的陈述,不是 Anthropic 或 OpenAI 的官方数字。反过来,Yuchen Jin 的单题反例也推翻不了这套由多评测合成的指数——正如这个指数本身回答不了他实际遇到的那道研究题。
另一层不确定来自档位。58 分绑定在 max effort 加默认回落的最高档配置上,同一模型在 xhigh、high 档位分别比最高档低 2 分和 4 分,成本坐标也随之不同,「哪个档位值得开」仍要按具体任务测算。在本文能核实的公开材料里,这 11 个新前沿点目前只有 Artificial Analysis 一家的坐标;Opus 5.5 的 58 分在真实工作里成色几何,还有待更多独立评测把它与从业者的单题实测放到一起检验。