AREX Feed Article
Arena 社区投票榜单:Claude Opus 5.5 (Max) 以 1,818 分登顶 Code Arena: WebDev,高出前代 126 分
北京时间 9 月 24 日上午 10 时 46 分(UTC 02:46),第三方评测平台 Arena(Arena.ai)的官方 X 账号 发帖宣布:Claude Opus 5.5 (Max) 以 1,818 分登顶其 Code Arena: WebDev 榜单,领先第二名 GPT-6 Astra (Max) 26 分,较前代 Opus 5 (Max) 的 1,692 分高出 126 分。Arena 称这一成绩「重塑了帕累托前沿」(reshapes the Pareto frontier),并公布 Opus 5.5 (Max) 另在四个类别排名第一、一个类别排名第二。
Claude Opus 5.5 由 Anthropic 于 9 月 22 日发布,称其为 Claude 5.5 家族首款模型,「在大多数工作中达到 Claude Fable 5.1 的水平」,运行成本较 Opus 5 低 40%;标注其上下文窗口为 1M token、最大输出 128K,每百万 token 输入 4 美元、输出 20 美元。截至 9 月 24 日,已有两家独立评测方给出该模型在各自榜单上的位置: 的智能指数目前把 Opus 5.5(自适应思考、Max Effort)以 58 分列在该站 169 个受评模型的第一位,而 Arena 这份基于社区投票的榜单是最新的一份。
两条差距:对着竞品,也对着前代
Arena 在帖文里对两条差距用了不同措辞:对第二名 GPT-6 Astra (Max) 写的是「扎实的 26 分领先」,对前代 Opus 5 (Max) 写的是「126 分的巨大提升」。两条成绩都带 (Max) 标注。帖末 Arena 向 Anthropic 表达了祝贺,并附有一张配图。
发帖约十小时后,这条帖子获得超过 1,300 赞、90 次转发和近 8.5 万次浏览。
WebDev 之外:跨类别名次与未给出的分数
同一条帖文列出了 Opus 5.5 (Max) 的跨类别名次:Brand & Marketing、Reference-Based Design、Data & Analytics、Simulations & Gaming 四个类别第一,Consumer Product 第二。帖内未给出这些类别的具体分数或票数,只预告「随着更多投票计入,还将有更多领域与类别层面的洞察发布」。
票数仍在累积:这份榜单的口径与限制
Arena 在 X 简介中自述其定位是「通过社区驱动评测来衡量并推进 AI 前沿」。这份榜单以社区投票为依据,票数仍在累积,上述名次属于可能变动的中间结果;帖子本身没有附票数规模、样本构成或误差范围。
(Max) 标注对应模型的最高 effort(思考投入)档位。平台文档显示,Claude Opus 5.5 的默认档位是 medium,自适应思考常开且无法关闭,登顶成绩出自最高档配置,而按默认设置调用的用户面对的是另一组条件。至于「帕累托前沿」,通常指在成本、速度、质量等相互制约的指标之间无法同时再改进的最优边界;Arena 未在帖文文字中说明其配图的具体统计口径。
Anthropic 自己在公告中也提醒:在这一能力水平上,基准测试的分差已不太能可靠反映真实世界的差距。
未经证实的 Sonnet 5.5 偷跑爆料,与官方的「数周内」
在 Arena 发帖前约一小时四十分钟(北京时间 24 日上午 9 时 03 分,UTC 01:03),X 账号 (约 1.06 万粉丝)发帖称,Anthropic 正在「偷跑测试」(stealth testing)Claude Sonnet 5.5,模型 ID 为 claude-sonnet-5-5;十余秒后在同帖串称,合作伙伴仅获得 24 小时访问权,模型为 1M 上下文、128K 最大输出、默认开启自适应思考,定价为每百万 token 输入 2 美元、输出 10 美元、缓存读取 0.20 美元。截至核验,这条爆料获得约 1,000 赞与 17.6 万次浏览。其中上下文窗口、最大输出与定价,与平台文档中现役 Claude Sonnet 5 的规格一致;但「偷跑测试」一事并未出现在 Anthropic 已发布的公告与文档中,爆料的具体数字也可能不准确,在 Anthropic 公开确认之前,它仍只是流传中的说法。
Anthropic 官方目前确认的后续是:公告明确写道,Claude Sonnet 5.5 与 Claude Haiku 5.5 将在未来数周内跟进,并带有多项与 Opus 5.5 相同的性能、效率与安全改进。